هل يخفي ChatGPT محارف غير مرئية في نصك؟

نظرية العلامة المائية، وما تُظهره البايتات فعلًا، وكيف تفحص نصك بنفسك.

تحتوي مخرجات الذكاء الاصطناعي غالبًا على محارف Unicode غير مرئية، وأكثرها شيوعًا المسافات غير الفاصلة والمسافات الضيقة غير الفاصلة. لكنها نواتج عرضية مألوفة لتنسيق النص وليست علامة مائية خفية. العلامات المائية النصية الحقيقية موجودة فعلًا وتعمل عبر تحيّز إحصائي في اختيار الكلمات، فلا تترك أي محارف خاصة يمكن العثور عليها. ويمكنك فحص أي نص بنفسك في ثوانٍ معدودة.

الادعاء وسبب انتشاره

كل بضعة أشهر ينتشر منشور يُظهر أن النص المنسوخ من ChatGPT يحتوي على محارف مخفية، مع استنتاج أن OpenAI تضع سرًّا علامة مائية على المخرجات كي يمكن تتبعها.

الملاحظة صحيحة. أما الاستنتاج فلا يدعمه دليل.

ما يعثر عليه الناس حقيقي فعلًا: الصق ردًّا من المحادثة في فاحص محارف وسترى غالبًا نقاط ترميز لا تُظهر أي شيء على الشاشة. القفزة تحدث في التفسير. فالعلامة المائية يجب أن تصمد أمام التحرير، وأن يصعب إزالتها، وأن ترمّز شيئًا ما. أما محارف تختفي لحظة تشغيل أي عملية بحث واستبدال، ولا تحمل أي حمولة قابلة للاسترجاع، فلا تحقق أيًّا من هذه الشروط.

ما الموجود فعلًا في النص

المحارف غير المرئية التي تظهر في مخرجات الذكاء الاصطناعي هي في أغلبها الساحق محارف طباعية عادية:

المحرف نقطة الترميز سبب ظهوره
مسافة غير فاصلة U+00A0 تُبقي الرقم ووحدته على سطر واحد
مسافة ضيقة غير فاصلة U+202F تباعد رفيع قبل علامات الترقيم وداخل الأرقام
مسافة صفرية العرض U+200B تلميحات لكسر الأسطر، وغالبًا موروثة من نصوص الويب
واصلة ناعمة U+00AD تحدد أين يجوز تقسيم الكلمة عند الالتفاف
علامة ترتيب البايتات U+FEFF أثر جانبي للترميز من ملف سابق في السلسلة

لكل محرف منها غرض طباعي مشروع، وكلها أقدم من النماذج اللغوية بعقود. وهي تصل عبر الطرق المعتادة نفسها: النموذج تعلّمها من نصوص التدريب التي احتوتها، وواجهة المحادثة تعرض المخرجات المنسقة كـ HTML، والنسخ من صفحة ويب معروضة ينقل معه ما احتواه الترميز.

هذا الطريق الأخير أهم مما يتوقع الناس. فالكثير مما يُنسب إلى النموذج يُدخِله في الحقيقة النسخ من المتصفح لا التوليد نفسه. ونسخ الرد نفسه عبر واجهة API يعطي كثيرًا من الأحيان نصًّا أنظف من نسخه من نافذة المحادثة.

ما تراهquarterly reportما يُخزَّن فعليًاquarterly[U+200B]report
المسافة الصفرية غير مرئية على الشاشة لكنها موجودة في النص الفعلي.

هل توجد أصلًا علامات مائية لنصوص الذكاء الاصطناعي؟

نعم، لكنها لا تعمل بالطريقة التي تفترضها المنشورات المنتشرة.

أفضل منهج موثّق هو SynthID-Text من Google DeepMind، وقد نُشر في مجلة Nature عام 2024. وهو يعمل عبر تحيّز خفي في الكلمات التي يختارها النموذج في كل خطوة، بحيث يحمل النص النهائي بصمة إحصائية يكتشفها مُتحقق مطابق. لا توجد أي محارف خاصة، ولا يُدرَج أي شيء. العلامة المائية كامنة في اختيار الكلمات العادية، ولهذا تصمد أمام النسخ والتحرير الخفيف، ولهذا لا يمكنك العثور عليها بفحص نقاط الترميز.

ناقشت OpenAI علنًا بحثها في العلامات المائية النصية، ولم تطرح تطبيقًا مؤكدًا موجهًا للمستهلكين لمخرجات ChatGPT.

المغزى العملي يناقض حالة الهلع: إذا كان النموذج الذي تستخدمه يحمل علامة مائية، فإزالة المحارف غير المرئية لن تزيلها. وإذا عثرت على محارف غير مرئية، فهذا ليس دليلًا على علامة مائية، بل دليل على تنسيق.

لماذا تهم المحارف غير المرئية على أي حال

سواء وُجدت علامة مائية أم لا، ستريد عادةً التخلص منها، لأنها تعطّل الأشياء بصمت:

  • يفشل البحث والبحث والاستبدال. مسافة صفرية العرض بين حرفين تعني أن البحث عن الكلمة لا يجد شيئًا، من دون سبب مرئي.
  • يرفض التحقق من النماذج الإدخال. بريد إلكتروني أو مفتاح ترخيص تليه مسافة غير فاصلة يفشل في مقارنة تبدو صحيحة على الشاشة.
  • الشيفرة تتعطل في بعض اللغات دون غيرها. المسافة غير الفاصلة مكان مسافة عادية خطأ صياغة في Python وGo وRuby وسطر الأوامر وJSON، ويشير إلى سطر يبدو سليمًا تمامًا. أما JavaScript وTypeScript وC فتقبل U+00A0 كمسافة بيضاء عادية وتُترجم من دون اعتراض — وهذه مشكلة بحد ذاتها، لأن المحرف يبقى بعدها في الملف حتى يصل إلى أداة تعترض عليه فعلًا.
  • تتلف عمليات استيراد CSV. علامة ترتيب البايتات تلتصق بترويسة العمود الأول، فيفشل تعيين الحقل الأول بصمت.
  • تظهر سجلات مكررة. مدخلان يبدوان متطابقين هما في الحقيقة سلسلتان مختلفتان، فتفشل إزالة التكرار في رصدهما.

هذه الأعطال مزعجة على وجه الخصوص لأن النص يبدو صحيحًا. فكل حدس في تتبع الأخطاء يوجّهك إلى مكان آخر.

كيف تفحص نصك وتنظفه

الصق النص في فاحص المحارف غير المرئية. يزيلها عند الطلب ويعرض ثلاثة أرقام: إجمالي المحارف المخفية التي عثر عليها، وكم منها كان صفري العرض، وكم منها كان واصلة ناعمة. ورقم المحارف الصفرية يشمل أيضًا علامتي الاتجاه من اليسار إلى اليمين ومن اليمين إلى اليسار، أما علامة ترتيب البايتات فتُحتسب ضمن الإجمالي من دون أن يكون لها سطر خاص بها. وحين تحتاج إلى معرفة أي محرف يقع في أي موضع بالضبط، فإن عارض المحارف غير المرئية يضع لكل واحد منها علامة في مكانه بدل حذفه. لا يغادر شيء متصفحك، فكلتا الأداتين تعمل محليًا.

وإذا أردت الصورة الأوسع، فإن منظف نصوص الذكاء الاصطناعي يغطي المحارف غير المرئية إلى جانب الشرطات الطويلة وعلامات الاقتباس المنحنية والرموز التعبيرية في تمريرة واحدة.

عادة تستحق الاكتساب: أجرِ الفحص كلما عبر النص حدودًا بين نظامين. من نافذة المحادثة إلى محرر الشيفرة، ومن صفحة الويب إلى جدول البيانات، ومن PDF إلى نموذج. هناك تتسبب المحارف غير المرئية في الضرر، وهناك تكون إزالتها أوفر ما تكون.

وللاطلاع على القائمة الكاملة لهذه المحارف ووظيفة كل منها، راجع مرجع محارف Unicode غير المرئية.

الأسئلة الشائعة

هل يضع ChatGPT علامة مائية على نصه بمحارف غير مرئية؟

لا يوجد دليل على ذلك. المحارف غير المرئية الموجودة في مخرجات ChatGPT هي محارف طباعية عادية كالمسافات غير الفاصلة والمسافات الضيقة غير الفاصلة، وهي موجودة منذ عقود ولا تحمل أي حمولة. كما أنها تختفي مع أي تنظيف أساسي، مما يجعلها عديمة الفائدة كعلامة مائية.

هل يمكن وضع علامة مائية على النص المولّد بالذكاء الاصطناعي أصلًا؟

نعم. تقنية SynthID-Text من Google DeepMind، المنشورة في Nature عام 2024، تحيّز اختيارات النموذج للكلمات بحيث تحمل المخرجات بصمة إحصائية. لا تُدرِج أي محارف خاصة، لذا لن يكشفها فحص نقاط الترميز أبدًا، وإزالة المحارف غير المرئية لا تزيلها.

لماذا يحتوي النص المنسوخ من ChatGPT على محارف مخفية؟

لأنك في الغالب تنسخ HTML معروضًا من صفحة ويب. واجهة المحادثة تعرض مخرجات منسقة، والنسخ يحمل محارف التباعد التي استخدمها ذلك التنسيق. واسترجاع الرد نفسه عبر واجهة API ينتج غالبًا نصًّا أنظف بشكل ملحوظ.

كيف أعثر على المحارف غير المرئية في نصي؟

الصقه في فاحص. يعرض فاحص المحارف غير المرئية لدينا كم محرفًا مخفيًا موجودًا، وكم منها صفري العرض، وكم منها واصلة ناعمة، ثم يزيلها عند الطلب. ولمعرفة أي محرف يقع في أي موضع، يضع عارض المحارف غير المرئية علامة لكل واحد منها في مكانه. وكلتاهما تعمل بالكامل داخل متصفحك.

هل المحارف غير المرئية خطيرة؟

ليست خطيرة، لكنها مُعطِّلة فعلًا. فهي تعطّل البحث، وتُفشل التحقق من النماذج، وتنتج أخطاء صياغة في الشيفرة، وتُتلف ترويسات CSV، وتُنشئ سجلات مكررة تبدو متطابقة. ولأن النص يبدو طبيعيًا، يصعب تشخيص هذه الأخطاء بشكل غير معتاد.

الأدوات المذكورة في هذا الدليل

أدلة ذات صلة