تحتوي مخرجات الذكاء الاصطناعي غالبًا على محارف Unicode غير مرئية، وأكثرها شيوعًا المسافات غير الفاصلة والمسافات الضيقة غير الفاصلة. لكنها نواتج عرضية مألوفة لتنسيق النص وليست علامة مائية خفية. العلامات المائية النصية الحقيقية موجودة فعلًا وتعمل عبر تحيّز إحصائي في اختيار الكلمات، فلا تترك أي محارف خاصة يمكن العثور عليها. ويمكنك فحص أي نص بنفسك في ثوانٍ معدودة.
الادعاء وسبب انتشاره
كل بضعة أشهر ينتشر منشور يُظهر أن النص المنسوخ من ChatGPT يحتوي على محارف مخفية، مع استنتاج أن OpenAI تضع سرًّا علامة مائية على المخرجات كي يمكن تتبعها.
الملاحظة صحيحة. أما الاستنتاج فلا يدعمه دليل.
ما يعثر عليه الناس حقيقي فعلًا: الصق ردًّا من المحادثة في فاحص محارف وسترى غالبًا نقاط ترميز لا تُظهر أي شيء على الشاشة. القفزة تحدث في التفسير. فالعلامة المائية يجب أن تصمد أمام التحرير، وأن يصعب إزالتها، وأن ترمّز شيئًا ما. أما محارف تختفي لحظة تشغيل أي عملية بحث واستبدال، ولا تحمل أي حمولة قابلة للاسترجاع، فلا تحقق أيًّا من هذه الشروط.
ما الموجود فعلًا في النص
المحارف غير المرئية التي تظهر في مخرجات الذكاء الاصطناعي هي في أغلبها الساحق محارف طباعية عادية:
| المحرف | نقطة الترميز | سبب ظهوره |
|---|---|---|
| مسافة غير فاصلة | U+00A0 | تُبقي الرقم ووحدته على سطر واحد |
| مسافة ضيقة غير فاصلة | U+202F | تباعد رفيع قبل علامات الترقيم وداخل الأرقام |
| مسافة صفرية العرض | U+200B | تلميحات لكسر الأسطر، وغالبًا موروثة من نصوص الويب |
| واصلة ناعمة | U+00AD | تحدد أين يجوز تقسيم الكلمة عند الالتفاف |
| علامة ترتيب البايتات | U+FEFF | أثر جانبي للترميز من ملف سابق في السلسلة |
لكل محرف منها غرض طباعي مشروع، وكلها أقدم من النماذج اللغوية بعقود. وهي تصل عبر الطرق المعتادة نفسها: النموذج تعلّمها من نصوص التدريب التي احتوتها، وواجهة المحادثة تعرض المخرجات المنسقة كـ HTML، والنسخ من صفحة ويب معروضة ينقل معه ما احتواه الترميز.
هذا الطريق الأخير أهم مما يتوقع الناس. فالكثير مما يُنسب إلى النموذج يُدخِله في الحقيقة النسخ من المتصفح لا التوليد نفسه. ونسخ الرد نفسه عبر واجهة API يعطي كثيرًا من الأحيان نصًّا أنظف من نسخه من نافذة المحادثة.
هل توجد أصلًا علامات مائية لنصوص الذكاء الاصطناعي؟
نعم، لكنها لا تعمل بالطريقة التي تفترضها المنشورات المنتشرة.
أفضل منهج موثّق هو SynthID-Text من Google DeepMind، وقد نُشر في مجلة Nature عام 2024. وهو يعمل عبر تحيّز خفي في الكلمات التي يختارها النموذج في كل خطوة، بحيث يحمل النص النهائي بصمة إحصائية يكتشفها مُتحقق مطابق. لا توجد أي محارف خاصة، ولا يُدرَج أي شيء. العلامة المائية كامنة في اختيار الكلمات العادية، ولهذا تصمد أمام النسخ والتحرير الخفيف، ولهذا لا يمكنك العثور عليها بفحص نقاط الترميز.
ناقشت OpenAI علنًا بحثها في العلامات المائية النصية، ولم تطرح تطبيقًا مؤكدًا موجهًا للمستهلكين لمخرجات ChatGPT.
المغزى العملي يناقض حالة الهلع: إذا كان النموذج الذي تستخدمه يحمل علامة مائية، فإزالة المحارف غير المرئية لن تزيلها. وإذا عثرت على محارف غير مرئية، فهذا ليس دليلًا على علامة مائية، بل دليل على تنسيق.
لماذا تهم المحارف غير المرئية على أي حال
سواء وُجدت علامة مائية أم لا، ستريد عادةً التخلص منها، لأنها تعطّل الأشياء بصمت:
- يفشل البحث والبحث والاستبدال. مسافة صفرية العرض بين حرفين تعني أن البحث عن الكلمة لا يجد شيئًا، من دون سبب مرئي.
- يرفض التحقق من النماذج الإدخال. بريد إلكتروني أو مفتاح ترخيص تليه مسافة غير فاصلة يفشل في مقارنة تبدو صحيحة على الشاشة.
- لا تُترجَم الشيفرة ولا تُحلَّل. مسافة غير فاصلة مكان مسافة عادية تنتج خطأ صياغة يشير إلى سطر يبدو سليمًا تمامًا.
- تتلف عمليات استيراد CSV. علامة ترتيب البايتات تلتصق بترويسة العمود الأول، فيفشل تعيين الحقل الأول بصمت.
- تظهر سجلات مكررة. مدخلان يبدوان متطابقين هما في الحقيقة سلسلتان مختلفتان، فتفشل إزالة التكرار في رصدهما.
هذه الأعطال مزعجة على وجه الخصوص لأن النص يبدو صحيحًا. فكل حدس في تتبع الأخطاء يوجّهك إلى مكان آخر.
كيف تفحص نصك وتنظفه
الصق النص في فاحص المحارف غير المرئية. يعرض تقريرًا بكل مسافة صفرية العرض وواصلة ناعمة وعلامة ترتيب بايتات وعلامة اتجاه يعثر عليها، مع عدد لكل نوع، ويزيلها عند الطلب. لا يغادر شيء متصفحك، فالفحص يعمل محليًا.
وإذا أردت الصورة الأوسع، فإن منظف نصوص الذكاء الاصطناعي يغطي المحارف غير المرئية إلى جانب الشرطات الطويلة وعلامات الاقتباس المنحنية والرموز التعبيرية في تمريرة واحدة.
عادة تستحق الاكتساب: أجرِ الفحص كلما عبر النص حدودًا بين نظامين. من نافذة المحادثة إلى محرر الشيفرة، ومن صفحة الويب إلى جدول البيانات، ومن PDF إلى نموذج. هناك تتسبب المحارف غير المرئية في الضرر، وهناك تكون إزالتها أوفر ما تكون.
وللاطلاع على القائمة الكاملة لهذه المحارف ووظيفة كل منها، راجع مرجع محارف Unicode غير المرئية.
الأسئلة الشائعة
هل يضع ChatGPT علامة مائية على نصه بمحارف غير مرئية؟
لا يوجد دليل على ذلك. المحارف غير المرئية الموجودة في مخرجات ChatGPT هي محارف طباعية عادية كالمسافات غير الفاصلة والمسافات الضيقة غير الفاصلة، وهي موجودة منذ عقود ولا تحمل أي حمولة. كما أنها تختفي مع أي تنظيف أساسي، مما يجعلها عديمة الفائدة كعلامة مائية.
هل يمكن وضع علامة مائية على النص المولّد بالذكاء الاصطناعي أصلًا؟
نعم. تقنية SynthID-Text من Google DeepMind، المنشورة في Nature عام 2024، تحيّز اختيارات النموذج للكلمات بحيث تحمل المخرجات بصمة إحصائية. لا تُدرِج أي محارف خاصة، لذا لن يكشفها فحص نقاط الترميز أبدًا، وإزالة المحارف غير المرئية لا تزيلها.
لماذا يحتوي النص المنسوخ من ChatGPT على محارف مخفية؟
لأنك في الغالب تنسخ HTML معروضًا من صفحة ويب. واجهة المحادثة تعرض مخرجات منسقة، والنسخ يحمل محارف التباعد التي استخدمها ذلك التنسيق. واسترجاع الرد نفسه عبر واجهة API ينتج غالبًا نصًّا أنظف بشكل ملحوظ.
كيف أعثر على المحارف غير المرئية في نصي؟
الصقه في فاحص يسرد نقاط الترميز، مثل فاحص المحارف غير المرئية لدينا. يحدد كل نوع من المحارف غير المرئية الموجودة ويعدّها ويزيلها عند الطلب، ويعمل بالكامل داخل متصفحك.
هل المحارف غير المرئية خطيرة؟
ليست خطيرة، لكنها مُعطِّلة فعلًا. فهي تعطّل البحث، وتُفشل التحقق من النماذج، وتنتج أخطاء صياغة في الشيفرة، وتُتلف ترويسات CSV، وتُنشئ سجلات مكررة تبدو متطابقة. ولأن النص يبدو طبيعيًا، يصعب تشخيص هذه الأخطاء بشكل غير معتاد.