الرموز (Tokens) هي أجزاء من الكلمات، لذا لا تتطابق أعدادها مع أعداد الكلمات أبدًا. في الإنجليزية العادية، يبلغ متوسط الرمز الواحد نحو أربعة إلى خمسة محارف، أي إن 1,000 كلمة تقع بين 1,050 و1,350 رمزًا تبعًا لمدى تقنية الكتابة. أما الشيفرة والكتابة بلغات غير إنجليزية والكلمات غير الشائعة فتستهلك رموزًا أكثر لكل محرف، وأحيانًا عدة أضعاف.
ما الرمز (Token) حقًا
النماذج اللغوية لا تقرأ محارف ولا كلمات. بل تقرأ رموزًا (Tokens): أجزاءً ناتجة عن تقسيم النص وفق مفردات ثابتة مُستفادة من بيانات التدريب.
الكلمات الشائعة تكون عادة رمزًا واحدًا، بينما تُقسَّم الكلمات النادرة إلى قطع. وعادة ما تُلحق المسافات بمقدمة الرمز التالي، ولهذا قد تُحتسب الكلمة نفسها بشكل مختلف بحسب وقوعها في بداية الجملة أم لا.
بقياس مجزئ رموز GPT-4o، تتكوّن الكلمة unbelievable وحدها من ثلاثة رموز: un + bel + ievable. أما إذا كُتبت كما ترد فعلًا داخل الجملة، بالمسافة التي تسبقها، فهي رمز واحد: unbelievable. هنا تعمل قاعدة المسافة السابقة: فالمدخل الذي تعلّمه النموذج هو الصيغة المسبوقة بمسافة، لأن هذه هي الطريقة التي ترد بها الكلمة في النص الجاري في أغلب الأحيان. وتتصرف the وinternational بالطريقة نفسها: رمز واحد لكل منهما مع المسافة الملتصقة بها.
لهذا تبدو أعداد الرموز غير قابلة للتنبؤ. فالوحدة ليست لغوية بل إحصائية؛ فالتكرار في مجموعة التدريب هو ما يحدد كون الشيء رمزًا واحدًا أو أربعة.
36 محرفًا · 7 رموز · نحو 5.1 محارف لكل رمز
قاعدة تقريبية في الإنجليزية: رمز واحد ≈ 4 محارف ≈ 0.75 كلمة.
الشيفرة والأحرف غير الإنجليزية والكلمات النادرة تستهلك رموزًا أكثر لكل محرف.
قواعد تقريبية صحيحة فعلًا
في النثر الإنجليزي، بقياس مجزئ رموز GPT-4o عبر سجلات لغوية تمتد من الكتابة المحادثية إلى النصوص التقنية المرجعية:
- رمز واحد ≈ 4.3–5.9 محرف
- رمز واحد ≈ 0.75–0.95 كلمة
- 1,000 كلمة ≈ 1,050–1,350 رمزًا
- صفحة قياسية (~500 كلمة) ≈ 530–680 رمزًا
السجل اللغوي يهم أكثر مما تعترف به معظم القواعد التقريبية. فالكتابة العفوية ذات الطابع المحادثي تقع قرب الحد الأدنى من ذلك النطاق، نحو 1,060 رمزًا لكل ألف كلمة، لأنها تعيد استخدام حصيلة صغيرة من الكلمات الشائعة التي يتسع كل منها لرمز واحد. أما النثر التقني الكثيف — ومنه أدلة هذا الموقع نفسه — فيقع قرب الحد الأعلى، نحو 1,310، لأن المصطلحات المتخصصة تتجزأ إلى قطع. والرقم المفرد المألوف، 1,300 رمز لكل ألف كلمة، هو الطرف التقني من النطاق لا وسطه، ولذلك يبالغ في تقدير الكتابة الاعتيادية بنحو الخُمس. وهذا هو الاتجاه الآمن للخطأ حين تحسب ميزانية نافذة سياق.
تنهار هذه القواعد بسرعة خارج النثر العادي:
| نوع المحتوى | تقريبًا |
|---|---|
| النثر الإنجليزي | 0.75–0.95 كلمة لكل رمز، حسب السجل اللغوي |
| الشيفرة | نحو 1.2 ضعف رموز النثر لكل محرف، ونحو 1.5 ضعف للفكرة نفسها معبَّرًا عنها بالطريقتين |
| JSON بمفاتيح طويلة | مرتفع جدًا — فعلامات الترقيم والاقتباس رموز مستقلة |
| الصينية واليابانية والكورية | نحو 0.6–0.7 رمز لكل محرف — أي أقل من رمز واحد لكل محرف، لكنه يظل عدة أضعاف ما تنفقه الإنجليزية على العدد نفسه من المحارف |
| السيريلية والديفاناغارية والعربية | نحو 1.4–1.6 ضعف الإنجليزية للنص نفسه |
| عناوين URL والبصمات (hashes) | مرتفعة للغاية — فالسلاسل العشوائية تُجزَّأ بشكل سيئ |
| المسافات المتكررة | رخيصة لا باهظة — فترميز أزواج البايتات يدمج السلاسل الطويلة، حتى إن أربعين مسافة متتالية تساوي رمزًا واحدًا |
الفجوة بين اللغات حقيقية لكنها أصغر بكثير مما يشيع في الأوساط. فبقياس صفحات هذا الموقع الإنجليزية في مقابل ترجماتها الاحترافية، تكلف النسخة اليابانية نحو 1.7 ضعف الإنجليزية، والكورية نحو 1.5، والصينية نحو 1.2، والهندية نحو 1.6، والعربية نحو 1.4. أما في ظل المجزئ الأقدم cl100k_base فكانت الأزواج نفسها عند 2.3 و2.3 و1.7 و4.7 و2.9 ضعفًا — ومن هنا جاء الرقم الذي يتكرر كثيرًا: "ضعفان إلى ثلاثة أضعاف الإنجليزية". كان صحيحًا حينها، لكن المفردات الأحدث أغلقت تلك الفجوة إلى حد بعيد.
لماذا يختلف العدد بين النماذج
تستخدم كل عائلة نماذج مجزئ رموز خاصًا بها بمفردات خاصة، لذا ينتج عن النص نفسه أعداد مختلفة.
تستخدم نماذج GPT صيغًا من ترميز أزواج البايتات — cl100k_base لنماذج حقبة GPT-4، وo200k_base للنماذج الأحدث. أما Claude فيستخدم مجزئًا مختلفًا بمفردات مختلفة. والنماذج المفتوحة مثل Llama وMistral لكل منها مجزئه الخاص أيضًا.
تتباعد المفردات أكثر ما تتباعد في الشيفرة والنصوص غير الإنجليزية، ولهذا تتباعد الأعداد هناك أكثر أيضًا.
عمليًا، هذا يعني:
- العدد الصادر عن مجزئ معيّن هو تقدير بالنسبة لأي نموذج آخر.
- مجزئ المزوّد نفسه وحده هو من يعطي رقمًا دقيقًا لفوترته.
- خطط بهامش أمان بدل الوصول إلى الحد تمامًا.
يعرض عدّاد الرموز لدينا عدد GPT-4o وتقدير Claude جنبًا إلى جنب. رقم GPT-4o عدّ حقيقي صادر عن مجزئ رموز، أما رقم Claude فليس كذلك عن قصد: إذ لا تنشر Anthropic مجزئ رموز يمكننا تشغيله داخل متصفحك، فالرقم تقدير قائم على المحارف بواقع رمز واحد لكل 3.5 محرف. وفي النثر الإنجليزي يقع هذا التقدير أعلى من عدّ GPT-4o بنسبة 22–50% — نحو الثلث في الكتابة الاعتيادية — لذا اقرأ الفارق على أنه سعة التقدير لا فرقًا مقيسًا بين عائلتي النماذج. ويبقى الرقمان معًا كافيين لمعرفة ما إذا كان الموجّه داخل الحد بأمان أم قريبًا منه بشكل مقلق؛ وحين يجب أن يكون الرقم دقيقًا، استخدم عدّاد المزوّد نفسه.
لماذا يهم هذا الرقم
التكلفة. تسعير الواجهات البرمجية (API) محسوب لكل رمز، بسعر منفصل للإدخال والإخراج، ويكون الإخراج عادة أغلى بعدة أضعاف. مضاعفة موجّه النظام تعني مضاعفة تلك التكلفة في كل استدعاء — وهو أمر غير مرئي أثناء الاختبار ومكلف عند التوسع.
حدود السياق. تغطي النافذة كل شيء: موجّه النظام وسجل المحادثة والمستندات المُسترجعة والرسالة الحالية والمساحة المحجوزة للرد. لا تفشل المحادثات الطويلة لأن رسالة واحدة طويلة، بل لأن السجل يتراكم.
الاقتطاع. عندما يتجاوز الإدخال الحد، يُحذف شيء ما — غالبًا من دون تنبيه، وغالبًا يكون المحتوى الأقدم. النموذج الذي "نسي" تعليماتك كثيرًا ما تكون قد اقتُطعت منه ببساطة.
التقسيم للاسترجاع. تقسيم المستندات للتضمين (embedding) يتم بالرموز لا بالمحارف. الأجزاء المُقاسة بعدد المحارف تكون غير متسقة، والأجزاء المقطوعة من منتصف الجملة تُسترجع بشكل سيئ، لذا يحتاج خط الاسترجاع إلى أداة تقسيم تحترم بنية الجمل والفقرات. وأداة تقسيم النص لدينا ليست تلك الأداة: فهي تقطع أجزاءً ثابتة الحجم لا تتجاوز 2,000 محرف، وتكسر عند أقرب مسافة بيضاء حتى لا تُقطع أي كلمة من المنتصف، ما يعني أن الجزء قد ينتهي في منتصف الجملة. استخدمها لتمرير مستند طويل عبر نافذة سياق أو حد لصق — لا لإنتاج أجزاء تضمين (embedding) للاسترجاع.
تقليل العدد من دون فقدان المعنى
أكثر وسائل التقليل تأثيرًا، مرتبة تقريبًا:
- قلّص سجل المحادثة. في المحادثات الطويلة يتجاوز أثره كل شيء آخر. لخّص الجولات القديمة بدل إعادة إرسالها حرفيًا.
- احذف التعليمات المكررة. تكرار قاعدة بثلاث صيغ لا يجعل الالتزام بها أكثر احتمالًا بثلاث مرات، لكنه يضاعف تكلفتها ثلاث مرات بكل تأكيد.
- تخلّص من مخلفات التنسيق. المحارف غير المرئية والمسافات المتكررة والأسطر الفاصلة الزخرفية كلها تُحتسب رموزًا. وهي منفردةً أرخص مما يتوقع الناس، لأن ترميز أزواج البايتات يدمج السلاسل الطويلة: فأربعون مسافة متتالية تساوي رمزًا واحدًا، وسطر فاصل من أربعين شرطة يساوي رمزين، مقابل ثلاثة عشر رمزًا للجملة التي فوقه. ومع ذلك تبقى عبئًا خالصًا، وفي مستند يضع فاصلًا بين كل قسم وآخر تتراكم. إزالة المحارف غير المرئية تتولى ما لا تراه.
- قصّر مفاتيح JSON في الموجّهات المنظمة. الفرق بين
{"n": ...}و{"customer_full_name": ...}مضروبًا في ألف سجل فرق كبير. - أرسل المقاطع ذات الصلة فقط. استرجاع ثلاث فقرات مناسبة أفضل من لصق مستند كامل، وعادة ما يعطي إجابات أفضل وأرخص معًا.
ما لا يساعد: حذف علامات الترقيم العادية أو إسقاط أدوات التعريف أو الكتابة بأسلوب برقي متقطع. فالوفورات هامشية والضرر على جودة المخرجات ليس كذلك.
الأسئلة الشائعة
كم عدد الرموز في 1,000 كلمة؟
بين نحو 1,050 و1,350 رمزًا، بقياس مجزئ رموز GPT-4o. الكتابة المحادثية تقع قرب 1,060 لأنها تعيد استخدام كلمات شائعة يتسع كل منها لرمز واحد؛ أما النثر التقني الكثيف فيقع قرب 1,310. أما الشيفرة وJSON فأعلى. والصينية واليابانية والكورية تستهلك نحو 0.6 إلى 0.7 رمز لكل محرف: رموز أقل من عدد المحارف، لكنها تظل عدة أضعاف ما تنفقه الإنجليزية على العدد نفسه من المحارف.
لماذا يختلف عدد الرموز بين GPT وClaude؟
تستخدم كل عائلة نماذج مجزئ رموز خاصًا بها بمفردات مُستفادة مختلفة، فيتجزأ النص نفسه بشكل مختلف، ويتسع الفارق أكثر ما يتسع في الشيفرة والنصوص غير الإنجليزية. ولاحظ أن رقم Claude في عدّاد الرموز لدينا تقدير قائم على المحارف بواقع رمز واحد لكل 3.5 محرف، لا عدًّا حقيقيًا صادرًا عن مجزئ رموز، ولهذا يقع أعلى من عدّ GPT-4o بنحو الثلث في النثر الإنجليزي.
ما الرمز (Token) في نماذج الذكاء الاصطناعي؟
جزء من النص مأخوذ من مفردات النموذج الثابتة. الكلمات الشائعة تكون عادة رمزًا واحدًا بينما تتجزأ الكلمات النادرة إلى عدة قطع، فكلمة 'unbelievable' قد تصبح ثلاثة رموز بينما 'international' رمز واحد فقط.
هل تُحتسب المسافات وعلامات الترقيم رموزًا؟
نعم. تُلحق المسافات عادة بمقدمة الرمز التالي، وكثيرًا ما تكون علامات الترقيم رموزًا مستقلة. والسلاسل الطويلة هي الاستثناء: فترميز أزواج البايتات يدمجها، حتى إن أربعين مسافة متتالية تساوي رمزًا واحدًا، وسطرًا فاصلًا من أربعين شرطة يساوي رمزين.
كيف أقلل استهلاك الرموز؟
ابدأ بتقليص سجل المحادثة المتراكم — فهو في المحادثات الطويلة يطغى على كل شيء آخر. ثم احذف التعليمات المكررة، وتخلّص من المحارف غير المرئية والمسافات المتكررة، وقصّر مفاتيح JSON، وأرسل المقطع ذا الصلة من المستند فقط بدل المستند كله.