ما هو token؟ ولماذا تكلّف العربية أكثر من الإنجليزية
شرح دقيق للرمز (Token) في النماذج اللغوية: لماذا لا يساوي كلمة، ولماذا تستهلك العربية رموزًا أكثر من الإنجليزية، وأثر ذلك على التكلفة.
الرمز (Token) هو أصغر وحدة نصية يتعامل معها النموذج اللغوي. قد يكون كلمة كاملة، أو جزءًا من كلمة، أو حرفًا واحدًا. وحين ترسل نصًا إلى نموذج، لا يرى النموذج النص كما تراه أنت، بل يرى سلسلة أرقام تمثّل هذه الرموز.
هذا التفصيل ليس تقنيًّا فحسب. له أثر مباشر على التكلفة: الواجهات البرمجية تُسعّر بعدد الرموز لا بعدد الكلمات. ولأن العربية تستهلك رموزًا أكثر من الإنجليزية للمعنى نفسه، فإن استعمال العربية يكلّف أكثر — وهذه معلومة يجهلها أغلب المبتدئين العرب.
لماذا لا يساوي الرمز كلمة؟
معظم النماذج تستخدم خوارزمية تسمى ترميز أزواج البايتات (Byte Pair Encoding). الفكرة: تبدأ من الأحرف الفردية، ثم تدمج تكرارًا أكثر الأزواج شيوعًا في رموز أكبر.
وحين يُدرَّب الترميز على نصوص إنجليزية بكثرة، يتعلّم أن كلمات شائعة مثل the وand تستحقّ رمزًا واحدًا لكلٍّ منها. أمّا الكلمات النادرة فتُقسَّم إلى أجزاء أصغر.
والعربية تواجه مشكلتين:
١. ندرة البيانات العربية في التدريب. معظم النماذج تُدرَّب على نصوص إنجليزية بنسبة غالبة. فيتعلّم الترميز رموزًا فعّالة للكلمات الإنجليزية الشائعة، ولا يتعلّم مثلها للعربية. والنتيجة أن الكلمات العربية تُقسَّم إلى أجزاء أصغر.
٢. الرجوع إلى البايتات. الأحرف العربية تُشفَّر في UTF-8 ببايتين لكل حرف. وحين يواجه الترميز تسلسلًا عربيًّا لم يتعلّم دمجه، يعود إلى ترميز كل بايت كرمز منفصل. فيصير الحرف الواحد رمزين أو أكثر.
الخصوبة: المقياس الذي يوضّح الفارق
المقياس المستخدم في الأبحاث يسمى «الخصوبة» (Fertility): متوسّط عدد الرموز لكل كلمة. في الإنجليزية تقترب من ١٫٣ — أي أن معظم الكلمات تبقى قطعة واحدة. وفي العربية تتراوح عادةً بين ٢ و٤ حسب الترميز.
دراسة قدّمت في EMNLP 2023 وجدت أن العربية من اللغات الخارجة عن المألوف في هذا القياس: النصّ العربي قد تقلّ أحرفه عن الإنجليزي، ويزيد عدد رموزه رغم ذلك.
| اللغة | الخصوبة التقريبية | ملاحظة |
|---|---|---|
| الإنجليزية | نحو ١٫٣ | معظم الكلمات الشائعة رمز واحد |
| العربية بترميز إنجليزي | بين ٢٫٥ و٤ | تقسيم إلى أحرف أو بايتات |
| العربية بترميز مخصّص | بين ١ و١٫٥ | ترميز مصمَّم للعربية يقلّص الفارق |
أثر ذلك على التكلفة
معظم الواجهات البرمجية تُسعّر بعدد الرموز. فإذا استهلكت العربية ضعفي أو ثلاثة أضعاف الرموز للمعنى نفسه، فهذا يعني:
- تكلفة أعلى: المهمة نفسها بالعربية قد تكلّف ضعفين إلى ثلاثة أضعاف.
- سياق أقصر: للنماذج حدّ أقصى للسياق، والعربية تملؤه أسرع، فيقلّ النصّ الذي يمكن معالجته في طلب واحد.
- استجابة أبطأ: معالجة رموز أكثر تستغرق وقتًا أطول.
متى لا يعنيك هذا الفارق؟
- عند الاستعمال الشخصي غير المتكرّر: الفارق في التكلفة ضئيل.
- عندما تكون المهمة قصيرة: محادثات قصيرة أو أسئلة واقعية لا تستهلك رموزًا كثيرة بأي لغة.
- عند استعمال خطط مجانية أو حدود سخيّة.
متى يجب أن تهتمّ به؟
- عند بناء تطبيق تجاري: إن كان تطبيقك سيخدم آلاف المستخدمين بالعربية، فارقُ ضعفين إلى ثلاثة أضعاف يعني فارقًا كبيرًا في الفاتورة الشهرية.
- عند معالجة نصوص طويلة: التلخيص وتحليل المستندات — العربية تملأ حدّ السياق أسرع.
- عند اختيار نموذج أو منصّة: بعض النماذج تستخدم ترميزًا يراعي العربية فيقلّ الفارق كثيرًا.
نصيحة عملية: قبل اختيار منصّة، اختبر عدد الرموز التي تستهلكها نصوصك العربية الفعلية بأدوات العدّ التي يوفّرها المزوّد. هذا أدقّ من الاعتماد على تقديرات عامة.
الأسئلة الشائعة
كم يساوي الرمز بالعربية مقارنة بالإنجليزية؟
لا رقم ثابت. التقديرات الشائعة تجعل الرمز في الإنجليزية نحو أربعة أحرف أو ثلاثة أرباع كلمة. أما في العربية فقد يساوي حرفًا واحدًا أو بايتًا، فتستهلك الكلمة الواحدة رمزين إلى أربعة.
هل هناك ترميز أفضل للعربية؟
نعم. بعض النماذج تستخدم ترميزًا يراعي العربية فيقلّص الخصوبة كثيرًا. تحقّق من توثيق المزوّد وقس بنفسك على نصوصك.
هل ينطبق الفارق على كل اللغات غير الإنجليزية؟
لا بالدرجة نفسها. اللغات ذات الأحرف اللاتينية تستهلك رموزًا أكثر من الإنجليزية وأقلّ من العربية. واللغات غير اللاتينية تواجه تحدّيات مشابهة بدرجات مختلفة.
كيف أقلّل التكلفة؟
اكتب نصوصًا مختصرة ومباشرة، وتجنّب الحشو، وحدّد طول المخرَج، واستفد من الترميز المخصّص إن دعمته المنصّة. وصمّم موجّهاتك لتقليل الإجابات الطويلة غير الضرورية، إذ يكون سعر رموز المخرَج أعلى عادةً.
المراجع
- Petrov, A. et al. Language Model Tokenizers Introduce Unfairness Between Languages. arXiv
- Ahia, O. et al. Do All Languages Cost the Same? Tokenization in the Era of Large Language Models. aclanthology.org
- Sennrich, R. et al. Neural Machine Translation of Rare Words with Subword Units. arXiv
- OpenAI. tiktoken — BPE tokeniser. github.com
- Hugging Face. Summary of the tokenizers. huggingface.co
اقرأ بعده
واجهة API للذكاء الاصطناعي: ما الذي ترسله وما يعود؟
شرح مبسّط لواجهة API للذكاء الاصطناعي: ما الذي ترسله إلى النموذج، وما الذي يعود، ولماذا لا يحتاج أغلب المطوّرين إلى تشغيل نموذج بأنفسهم.
اقرأ المقالمصطلحات الذكاء الاصطناعي: معجم مبسّط للمبتدئين
معجم مختصر لأهمّ مصطلحات الذكاء الاصطناعي: كل مصطلح بسطر تعريف وسطر «متى تصادفه»، مع روابط إلى مقالات تفصيلية على الموقع.
اقرأ المقالتعلّم الذكاء الاصطناعي من الصفر: مسار بمراحل وأزمنة
مسار عملي لتعلّم الذكاء الاصطناعي من الصفر بمراحل وأزمنة واقعية، مع تحديد صريح لما يمكن تخطّيه ولما لا يُغتفَر تخطّيه.
اقرأ المقالنشرة إسناد الأسبوعية
ثلاثة أشياء مفيدة كل أسبوع: ورقة بحثية مشروحة، قياس عملي، وخطأ شائع رأيناه في الإنتاج. بلا حشو وبلا رعايات مخفية.