قياس الهلوسة: من الشكوى إلى رقم
تعريف إجرائي للهلوسة يمكن قياسه، وطريقة تفكيك الجواب إلى ادعاءات والتحقّق منها، ولماذا الجواب الصحيح غير المسنَد يُحسب هلوسة أيضًا.
«النظام يهلوس» شكوى، لا تشخيص. ولا يمكن إصلاح ما لا يُقاس. هذا المقال يحوّل الشكوى إلى رقم تتبعه عبر الإصدارات.
تعريف إجرائي
الهلوسة: ادعاء في الجواب لا تدعمه المقاطع المسترجَعة.
هذا التعريف عمليّ لثلاثة أسباب: قابل للتطبيق آليًّا، ولا يحتاج معرفة بالعالم، ويقيس ما تتحكّم فيه فعلًا. وينتج عنه حكم يفاجئ البعض: الادعاء الصحيح واقعيًّا لكنه غير مسنَد يُحسب هلوسة — لأن النظام لم يستند إلى مصدر، وصحّته صدفة لا خاصية.
الطريقة: تفكيك ثم تحقّق
- فكّك الجواب إلى ادعاءات ذرّية: «الإجازة خمسة أيام» و«تُطلب خلال شهر» ادعاءان لا واحد.
- تحقّق من كل ادعاء مقابل المقاطع المسترجَعة: مدعوم · متناقض · غير موجود.
- احسب: الإخلاص = المدعوم ÷ المجموع.
| الحالة | الحكم |
|---|---|
| ورد نصًّا في مقطع | مدعوم |
| يناقض مقطعًا | خطأ صريح — الأخطر |
| لا أثر له في المقاطع | هلوسة |
| صحيح واقعيًّا وغير وارد | هلوسة (بلا سند) |
التفكيك والتحقّق يقومان آليًّا بحَكَم نموذجي — وهو ما تفعله أطر مثل RAGAS [1] — مع تدقيق بشري على عيّنة، لأن الحَكَم نفسه يخطئ.
اقسم النتيجة لتعرف السبب
الرقم المجمّع لا يقول أين العطل. قسّم الحالات:
- استُرجع المقطع الصحيح والجواب غير مسنَد ← مشكلة توليد: شدّد التقييد، وافرض الاستشهاد، وراجع درجة العشوائية.
- لم يُسترجَع المقطع الصحيح ← مشكلة استرجاع: التقطيع أو التضمين أو
k. هذا هو الغالب. - لا مقطع صحيحًا موجودًا أصلًا ← فجوة محتوى: يجب أن يمتنع النظام، والعلاج تحريري لا هندسي.
هذا التقسيم وحده يوفّر أسابيع: أغلب ما يُشكى منه كهلوسة هو استرجاع فاشل ملأ النموذج فراغه.
ما يخفض الرقم فعلًا
| الإجراء | الأثر |
|---|---|
| تحسين الاسترجاع (هجين + إعادة ترتيب) | الأكبر عادةً |
| إتاحة «لا أعرف» كمخرج مشروع | كبير وفوري |
| فرض استشهاد بعد كل جملة | كبير — ويجعل المراجعة ممكنة |
| ترتيب المقاطع فتكون الأقوى في طرفَي السياق [2] | متوسط |
| خفض درجة العشوائية | متوسط |
| تقليل عدد المقاطع المحشوّة | متوسط — أقلّ ضجيجًا |
متى لا يكفي هذا القياس
الإخلاص يقيس السند لا الصواب. نظام يقتبس من مستند خاطئ أو قديم يسجّل إخلاصًا ممتازًا وهو يضلّل المستخدم. لذلك يُقرأ الإخلاص دائمًا مع: صحّة المصدر نفسه، وحوكمة المحتوى (تاريخ وصلاحية)، ونسبة الامتناع الصحيح.
من الرقم إلى القرار
القياس بلا عتبة قرار تمرين إحصائي. اربط الرقم بفعل قبل أن تبدأ:
- حدّد عتبة إطلاق مكتوبة: ما أعلى نسبة ادعاءات غير مسنودة تقبلها قبل النشر؟ العتبة تختلف بالمجال — نظام يجيب عن سياسة إجازات ليس كنظام يجيب عن جرعة دواء — لكن وجودها مكتوبةً غير قابل للتفاوض.
- اقسم العتبة حسب الخطورة. ادعاء غير مسنود في رقم أو تاريخ أو اسم أخطر من ادعاء في صياغة عامّة. عتبة واحدة لكل الأنواع إمّا متساهلة على الخطير أو متشدّدة على الهيّن.
- اربط كل تجاوز بإجراء محدّد مسبقًا: تشديد المُوجّه، أو رفع عتبة الاسترجاع، أو إضافة «لا أعرف» كمخرَج مقبول، أو إيقاف الميزة. القائمة تُكتب قبل الحاجة، وإلّا صار العلاج تخمينًا تحت ضغط.
- قِس بعد كل علاج، وسجّل الرقمين معًا. سلسلة الأرقام عبر الأشهر هي التي تُثبت أن نظامك يتحسّن — لا رقم واحد يُعرَض في اجتماع.
والقاعدة التي تسبق كل ما سبق: الادعاء الذي لا يمكن ردّه إلى مقطع مسترجَع يُعدّ غير مسنود، ولو كان صحيحًا في الواقع. القياس عن السند لا عن الصدق.
الأخطاء الشائعة
- قياس الهلوسة بلا فصل الاسترجاع عن التوليد.
- عدّ الجواب «صحيحًا» لأنه صحيح واقعيًّا رغم غياب السند.
- الاكتفاء بمقياس آليّ بلا أي تدقيق بشري.
- غياب أسئلة بلا جواب من مجموعة الاختبار.
- مطاردة التوجيه بينما العطل في المحتوى نفسه.
الأسئلة الشائعة
ما الرقم المقبول؟
يعتمد على المخاطرة: مساعد داخلي يحتمل ما لا يحتمله نظام يمسّ مالًا أو صحّة. المهم أن تحدّد سقفًا مكتوبًا، وتقيسه في كل إصدار، وتمنع تجاوزه ببوابة في CI.
هل الضبط الدقيق يقلّل الهلوسة؟
قد يقلّل هلوسة الصيغة، لكنه لا يمنح النظام مصدرًا يستند إليه. هلوسة الحقائق تُعالَج بالتأريض والاستشهاد وإتاحة الامتناع.
كيف أراقبها في الإنتاج؟
عيّنة يومية من المحادثات تمرّ على الحَكَم، مع مؤشرات غير مباشرة: نسبة «لا أعرف»، ومعدّل إعادة صياغة المستخدم لسؤاله، وبلاغات الخطأ. الاتجاه أهمّ من الرقم اليومي.
المراجع
- Es, S. et al. RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217
- Liu, N. et al. Lost in the Middle. arXiv:2307.03172
- Zheng, L. et al. Judging LLM-as-a-Judge with MT-Bench. arXiv:2306.05685
- Lewis, P. et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401
أدوات مذكورة في هذا المقال
اقرأ بعده
بناء مجموعة اختبار ذهبية بخمسين سؤالًا
كيف تجمع خمسين سؤالًا حقيقيًّا وتوثّق إجاباتها لتصير معيارًا يقيس كل تغيير في نظامك، وأي فئات الأسئلة لا يجوز أن تنقص منها.
اقرأ المقالتقييم أنظمة RAG: من الانطباع إلى رقم تثق به
كيف تبني مجموعة اختبار ذهبية في يوم، وأي المقاييس تخصّ الاسترجاع وأيها تخصّ التوليد، وماذا كشفت ورقة MT-Bench عن حدود حكم النموذج على النموذج.
اقرأ المقالحكم النموذج على النموذج: أين يصدق وأين ينهار
ما أثبتته ورقة MT-Bench عن اتفاق النماذج الحاكمة مع البشر، وثلاثة انحيازات موثّقة تفسد الحكم، وكيف تعاير حَكَمك قبل الاعتماد عليه.
اقرأ المقالنشرة إسناد الأسبوعية
ثلاثة أشياء مفيدة كل أسبوع: ورقة بحثية مشروحة، قياس عملي، وخطأ شائع رأيناه في الإنتاج. بلا حشو وبلا رعايات مخفية.