تخطَّ إلى المحتوى
إسنادISNAD
التقييم والقياس

حكم النموذج على النموذج: أين يصدق وأين ينهار

ما أثبتته ورقة MT-Bench عن اتفاق النماذج الحاكمة مع البشر، وثلاثة انحيازات موثّقة تفسد الحكم، وكيف تعاير حَكَمك قبل الاعتماد عليه.

نُشر 4 دقائق قراءة

تقييم نصّ مفتوح بمقياس آليّ مشكلة قديمة: المقاييس التقليدية القائمة على تطابق الكلمات تعاقب الصياغة المختلفة الصحيحة وتكافئ التشابه السطحي. ومن هنا جاءت فكرة الحَكَم النموذجي: نموذج قويّ يقرأ الجواب ويحكم عليه بمعيار مكتوب.

ماذا تقول التجربة

فحصت ورقة MT-Bench [1] هذه الفكرة على محادثات متعدّدة الأدوار، وخلصت إلى أن النماذج القوية بوصفها حكّامًا تتفق مع تفضيلات البشر بنسبة تتجاوز ٨٠٪ — وهي قريبة من نسبة اتفاق البشر بعضهم مع بعض. النتيجة عملية: الحَكَم النموذجي بديل معقول عن التقييم البشري في التتبّع اليومي، لا في الحكم النهائي.

ثلاثة انحيازات وعلاجها

الانحياز ما يحدث العلاج
الموضع تفضيل الجواب الأول في المقارنات شغّل المقارنة بالاتجاهين واحسب المتوسط
الإطناب الجواب الأطول يبدو أفضل قيّد المعيار بالدقّة، وامنع مكافأة الشمول
الذات تفضيل الأسلوب المشابه لأسلوبه حَكَم من عائلة مختلفة عن نموذج التوليد

وأضف رابعًا عمليًّا: انحياز الثقة — النبرة الواثقة تُقرأ صحّةً. عالِجه بمعيار يطالب بالاستناد إلى المقاطع لا بالانطباع.

كيف يُكتب المعيار

المعيار الفضفاض ينتج حكمًا فضفاضًا. اجعله مستويات محدّدة، واطلب مخرجًا مبنيًّا:

قيّم إخلاص الجواب للمقاطع المرفقة (١–٥):
٥ = كل جملة مدعومة نصًّا بالمقاطع.
٤ = مدعوم كله عدا تفصيل ثانوي.
٣ = الفكرة العامة مدعومة وفيها تفصيل غير وارد.
٢ = ادعاء جوهري غير مدعوم.
١ = معلومات لا أثر لها في المقاطع.

أعد: {"score": n, "unsupported": ["الجملة…"], "why": "سطر واحد"}
اعتمد على المقاطع وحدها، ولا تستعن بمعرفتك العامة.

حقل unsupported وحده يبرّر التصميم: يحوّل الحكم من رقم غامض إلى قائمة قابلة للتدقيق البشري في ثوانٍ.

المعايرة: الخطوة التي تُهمَل

  1. اختر ٣٠–٥٠ حالة وقيّمها بشريًّا.
  2. شغّل الحَكَم على الحالات نفسها.
  3. احسب نسبة الاتفاق، وافحص كل خلاف: هل المعيار غامض أم الحَكَم مخطئ؟
  4. عدّل المعيار وأعد الكرّة حتى يستقرّ الاتفاق عند حدّ تقبله.
  5. بعد الاعتماد، دقّق بشريًّا عيّنة دورية (١٠–٢٠٪ في البداية).

متى لا تستعمل حَكَمًا نموذجيًّا

  • حين يوجد مقياس حسابيّ: الاسترجاع يُقاس بـRecall@k، والصيغة المهيكلة تُتحقَّق برمجيًّا. لا تستدعِ نموذجًا لما تحسبه دالة.
  • القرارات عالية الأثر: الأمان والامتثال والمحتوى الحسّاس تحتاج بشرًا.
  • قبل كتابة معيار واضح: بلا معيار محدّد، تقيس مزاج النموذج.

كم مثالًا تحتاج للمعايرة

سؤال يتكرّر: كم حكمًا بشريًّا يلزم قبل الوثوق بالحَكَم النموذجي؟ لا رقم سحريًّا، لكن الإجراء واضح:

  • ابدأ بخمسين مثالًا محكومًا بشريًّا، مختارة عمدًا لتغطّي الجيّد والسيّئ والحدّي — لا عيّنة عشوائية يغلب عليها السهل.
  • احسب نسبة الاتفاق بين الحَكَم النموذجي والحكم البشري. اتفاق دون ٨٠٪ يعني أن معيارك غامض غالبًا لا أن النموذج ضعيف: أعد كتابة المعيار بأمثلة، ثم أعد القياس.
  • انظر إلى الاختلافات واحدًا واحدًا. كل اختلاف إمّا خطأ من الحَكَم، أو خطأ من المحكِّم البشري، أو غموض في المعيار نفسه — والثالث هو الأشيع، وهو الوحيد الذي يُصلح مرّة فتنتفع منه كل الأحكام اللاحقة.
  • أعد المعايرة عند كل تغيير: نموذج الحَكَم، أو نصّ المعيار، أو حتى إصداره. الحَكَم المعاير على نسخة قديمة يعطي أرقامًا لا تقارَن بما قبلها.

واحتفظ بالخمسين مجموعةً مجمّدة. حين ترتفع درجاتك فجأةً، هي التي تخبرك: أتحسّن النظام، أم تراخى الحَكَم؟

الأخطاء الشائعة

  1. اعتماد الحَكَم بلا معايرة بشرية أصلًا.
  2. حَكَم من عائلة نموذج التوليد نفسه.
  3. معيار «قيّم الجودة من ١٠» بلا تعريف مستويات.
  4. مقارنة أ/ب باتجاه واحد.
  5. تغيير المعيار بين الإصدارات، فتصير الأرقام غير قابلة للمقارنة.

الأسئلة الشائعة

أي نموذج أستعمل حَكَمًا؟

الأقوى الذي تحتمل كلفته، ومن عائلة مختلفة عن نموذج الإنتاج. تكلفة الحَكَم مقبولة لأنه يعمل على عيّنة تقييم لا على حركة المستخدمين.

هل يصلح للعربية؟

نعم مع النماذج متعدّدة اللغات القوية، بشرط أن يكون المعيار مكتوبًا بالعربية وأن تكون المعايرة على أمثلة عربية — الاتفاق يختلف باختلاف اللغة والمجال.

كيف أستعمله للمقارنة بين إصدارين؟

مقارنة زوجية: الجواب من الإصدارين لنفس السؤال، بالاتجاهين، ثم احسب نسبة الفوز. أوضح من رقم مطلق وأقلّ تأثّرًا بانحياز المستويات.

المراجع

  1. Zheng, L. et al. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023. arXiv:2306.05685
  2. Es, S. et al. RAGAS. arXiv:2309.15217
  3. Ouyang, L. et al. Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155
  4. Liu, N. et al. Lost in the Middle. arXiv:2307.03172

أدوات مذكورة في هذا المقال

اقرأ بعده

غلاف مقال: بناء مجموعة اختبار ذهبية بخمسين سؤالًا
التقييم4 دقائق قراءة

بناء مجموعة اختبار ذهبية بخمسين سؤالًا

كيف تجمع خمسين سؤالًا حقيقيًّا وتوثّق إجاباتها لتصير معيارًا يقيس كل تغيير في نظامك، وأي فئات الأسئلة لا يجوز أن تنقص منها.

اقرأ المقال
غلاف مقال: قياس الهلوسة: من الشكوى إلى رقم
التقييم4 دقائق قراءة

قياس الهلوسة: من الشكوى إلى رقم

تعريف إجرائي للهلوسة يمكن قياسه، وطريقة تفكيك الجواب إلى ادعاءات والتحقّق منها، ولماذا الجواب الصحيح غير المسنَد يُحسب هلوسة أيضًا.

اقرأ المقال
غلاف مقال: تقييم أنظمة RAG: من الانطباع إلى رقم تثق به
التقييم5 دقائق قراءة

تقييم أنظمة RAG: من الانطباع إلى رقم تثق به

كيف تبني مجموعة اختبار ذهبية في يوم، وأي المقاييس تخصّ الاسترجاع وأيها تخصّ التوليد، وماذا كشفت ورقة MT-Bench عن حدود حكم النموذج على النموذج.

اقرأ المقال

نشرة إسناد الأسبوعية

ثلاثة أشياء مفيدة كل أسبوع: ورقة بحثية مشروحة، قياس عملي، وخطأ شائع رأيناه في الإنتاج. بلا حشو وبلا رعايات مخفية.

النشرة البريدية لم تُفتَح بعد. حتى ذلك الحين، تصلك المقالات كاملةً عبر تغذية RSS.