تخطَّ إلى المحتوى
إسنادISNAD
الاسترجاع المعزّز (RAG)

إعادة الترتيب (Reranking): كم تكلّفك الدقّة من الكمون؟

الفرق بين النموذج ثنائي الترميز والنموذج التقاطعي، ولماذا ترفع إعادة الترتيب دقّة RAG، وكم مرشّحًا تُعيد ترتيبه قبل أن ينفجر زمن الاستجابة.

نُشر 4 دقائق قراءة

في كل نظام استرجاع رأيت دقّته تتحسّن قفزةً واحدة، كان السبب طبقة إعادة ترتيب أُضيفت بين البحث والتوليد. وفي كل نظام رأيت كمونه ينفجر فجأة، كان السبب الطبقة نفسها مطبَّقة على قائمة أطول مما ينبغي.

لماذا يوجد نوعان من النماذج

النموذج ثنائي الترميز (bi-encoder) يحوّل السؤال والمقطع إلى متجهين منفصلين، ثم يقارنهما بحساب رخيص. ولأن متجهات المستندات تُحسب مرة واحدة وتُخزَّن، يصلح للبحث في ملايين المقاطع — لكنه لا يرى السؤال والمقطع معًا أبدًا.

النموذج التقاطعي (cross-encoder) يمرّر السؤال والمقطع في مدخل واحد، فتعمل طبقات الانتباه على النصّين معًا وتلتقط علاقات دقيقة يفوتها الأول [1]. الثمن أن كل زوج يحتاج تمريرة كاملة: لا يمكن حساب شيء مسبقًا.

ثنائي الترميز تقاطعي
متى يُحسب التمثيل مسبقًا للمستندات وقت الاستعلام لكل زوج
الحجم المناسب ملايين المقاطع عشرات
الدقّة جيدة أعلى
التكلفة ضئيلة خطّية بعدد المرشّحين

المعمارية الصحيحة: قمع لا مصفاة واحدة

استرجاع هجين  →  ٥٠ مرشّحًا  →  إعادة ترتيب  →  أعلى ٥  →  التوليد

كل طبقة مسؤولة عن رقم مختلف: الاسترجاع مسؤول عن الاستدعاء (Recall@50)، وإعادة الترتيب مسؤولة عن الدقّة (Precision@5). خلط المسؤوليتين هو ما يجعل الفريق يضبط الوصلة الخاطئة شهرًا كاملًا.

وأثر ذلك على التوليد مزدوج: مقاطع أنظف تعني رموزًا أقلّ في السياق (تكلفة أقلّ)، وتشتّتًا أقلّ للنموذج — خصوصًا مع ما وثّقته دراسة Lost in the Middle [2] من تراجع الدقّة حين تُدفن المعلومة وسط سياق مزدحم.

الحساب الذي يجب أن تجريه

زمن إعادة الترتيب ≈ عدد المرشّحين × زمن الزوج الواحد. إن كان زمن الزوج ١٠ أجزاء من الألف من الثانية:

  • ٢٠ مرشّحًا ← ٠٫٢ ثانية تقريبًا: مقبول في واجهة تفاعلية.
  • ١٠٠ مرشّح ← ثانية كاملة: مرفوض غالبًا.
  • ٥٠٠ مرشّح ← خمس ثوانٍ: خارج النقاش.

قِس زمن الزوج على عتادك أنت — يختلف بحجم النموذج وطول المقطع اختلافًا كبيرًا — ثم اختر العدد الذي يبقيك تحت سقف الكمون المقبول.

متى لا تحتاج إعادة الترتيب

  • قاعدة صغيرة: خمسمئة مقطع يبحثها الاسترجاع الهجين بدقّة كافية.
  • كمون حرج: مساعد صوتي أو إكمال فوري لا يحتمل مئات الأجزاء الإضافية.
  • قبل قياس الاستدعاء: إن كان Recall@50 منخفضًا فالعطل قبل هذه الطبقة، وإضافتها إخفاء للمشكلة.

كيف تختار عدد المرشّحين

الرقمان الحاكمان في القمع هما: كم مستندًا يدخل إعادة الترتيب، وكم يخرج منها. اضبطهما بالقياس لا بالافتراض:

  1. ابدأ من سؤال الاستدعاء: عند أي عدد مرشّحين يظهر المستند الصحيح ضمنهم في ٩٥٪ من أسئلتك؟ هذا هو الحدّ الأدنى لمدخل إعادة الترتيب — وزيادة عليه تكلفة بلا عائد.
  2. قِسه على مجموعتك الذهبية، مرّة عند عشرة مرشّحين ومرّة عند خمسين ومرّة عند مئة. المنحنى يستوي عند نقطة ما؛ تلك النقطة جوابك.
  3. حدّد المخرَج بميزانية السياق لا بالرغبة. خمسة مقاطع دقيقة تتفوّق على عشرين مقطعًا نصفها ضجيج — والضجيج يزاحم الإجابة داخل السياق ويرفع التكلفة معًا.
  4. احسب الكمون المضاف عند كل عدد مرشّحين، لا الجودة وحدها. إعادة الترتيب تعمل بشكل خطّي تقريبًا مع عدد المرشّحين، والقفزة من خمسين إلى مئة قد تكلّفك أكثر مما تربح.

وأعد هذا الضبط عند كل تغيير في نموذج التضمين أو في طريقة التقطيع. الأرقام التي ضُبطت على فهرس قديم لا تنتقل إلى فهرس جديد.

الأخطاء الشائعة

  1. إعادة ترتيب القائمة كاملة بدل قمّتها.
  2. توقّع أن ترفع الاستدعاء — وظيفتها التنقية لا التوسيع.
  3. قياس الأثر بمقياس واحد بدل Recall@k قبلها وPrecision@k بعدها.
  4. إهمال زمن الاستجابة عند المئين ٩٥: المتوسط يخفي الذيل الذي يشتكي منه المستخدم.

الأسئلة الشائعة

هل أحتاج نموذج إعادة ترتيب خاصًّا بالعربية؟

النماذج التقاطعية متعدّدة اللغات تعمل جيدًا على العربية، لكن الفيصل قياسك أنت على مجموعتك الذهبية. جرّب مرشّحين أو ثلاثة وقارن Precision@5 وزمن الزوج معًا.

كم مرشّحًا هو الرقم الصحيح؟

ابدأ بـ٢٥، وقِس. ارفع إلى ٥٠ إن تحسّنت الدقّة تحسّنًا يبرّر الكمون، وتوقّف عند أول نقطة يتوقّف فيها التحسّن — المكسب يتلاشى بسرعة بعد العشرات الأولى.

هل يمكن الاستغناء عنها بنموذج تضمين أقوى؟

جزئيًّا. التضمين الأقوى يرفع جودة المرشّحين، لكنه يبقى مقيّدًا ببنية ثنائي الترميز التي لا ترى السؤال والمقطع معًا. الطبقتان تعالجان مشكلتين مختلفتين.

المراجع

  1. Nogueira, R. & Cho, K. Passage Re-ranking with BERT. arXiv:1901.04085
  2. Liu, N. et al. Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172
  3. Thakur, N. et al. BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of IR Models. arXiv:2104.08663
  4. Reimers, N. & Gurevych, I. Sentence-BERT. arXiv:1908.10084

أدوات مذكورة في هذا المقال

اقرأ بعده

غلاف مقال: البحث الهجين: متى يتفوّق BM25 على المتجهات
RAG5 دقائق قراءة

البحث الهجين: متى يتفوّق BM25 على المتجهات

ما أثبته تقييم BEIR عن ضعف النماذج الكثيفة خارج نطاق تدريبها، وكيف تدمج BM25 مع المتجهات بخوارزمية RRF، وأين تضع إعادة الترتيب دون أن ينفجر الكمون.

اقرأ المقال
غلاف مقال: نافذة السياق الطويلة: هل ألغت الحاجة إلى RAG؟
RAG4 دقائق قراءة

نافذة السياق الطويلة: هل ألغت الحاجة إلى RAG؟

ما الذي تغيّره نوافذ السياق الكبيرة فعلًا، ولماذا يتراجع أداء النماذج حين تُدفن المعلومة وسط سياق طويل، ومتى يكون الحشو أرخص من الاسترجاع.

اقرأ المقال
غلاف مقال: دليل RAG الكامل: من المستند إلى إجابة موثوقة
RAG8 دقائق قراءة

دليل RAG الكامل: من المستند إلى إجابة موثوقة

خط أنابيب الاسترجاع المعزّز بمراحله الست، وأين ينكسر فعلًا في الإنتاج، وما تقوله أوراق BEIR وDPR و«الضياع في المنتصف» عن كل قرار تتخذه فيه.

اقرأ المقال

نشرة إسناد الأسبوعية

ثلاثة أشياء مفيدة كل أسبوع: ورقة بحثية مشروحة، قياس عملي، وخطأ شائع رأيناه في الإنتاج. بلا حشو وبلا رعايات مخفية.

النشرة البريدية لم تُفتَح بعد. حتى ذلك الحين، تصلك المقالات كاملةً عبر تغذية RSS.