دليل تقني

معالجة اللغة العربية الحديثة: تطبيق الاسترجاع المعزّز (RAG) للهجات العربية

دليل عملي لمعالجة اللغة العربية: التقطيع، التشكيل، اللهجات، التمثيلات المتّجهة، وبناء أنابيب الاسترجاع المعزّز (RAG) التي تعمل فعلًا مع العربية ولهجاتها.

لماذا تختلف معالجة اللغة العربية؟

العربية لغة غنية صرفيًا، تُكتب من اليمين إلى اليسار، ولها فصحى مشتركة (المعيارية الحديثة) وعشرات اللهجات الإقليمية — الشامية، الخليجية، المصرية، المغاربية وغيرها. يولّد الجذر الواحد أشكالًا سطحية كثيرة عبر السوابق واللواحق والأوزان، كما أن التشكيل الذي يزيل اللبس يُحذف غالبًا في النصوص الفعلية. لذلك تفشل خطوط معالجة اللغة الإنجليزية الجاهزة على العربية، ويلزم بناء أنبوب معالجة عربي من الأساس.

١. التطبيع والتقطيع

  • توحيد صور الألف (أ إ آ → ا) والياء/الألف المقصورة (ى ↔ ي) عند الحاجة للبحث، مع الحفاظ عليها للتوليد.
  • حذف التطويل (ـ) وعلامات التحكم، والاحتفاظ بالتشكيل فقط إذا كانت المهمة تستفيد منه.
  • استخدام مقطّع فرعي (SentencePiece / BPE) مدرّب على العربية بدل التقطيع بالمسافات، لأن السوابق مثل "و" "ل" "ب" "ك" تلتصق بالكلمة.
  • تفضيل نماذج بتغطية عربية قوية مثل AraBERT وCAMeLBERT وMARBERT وJais، إضافة إلى النماذج متعدّدة اللغات (GPT-4 وClaude وGemini).

٢. التعامل مع اللهجات

يكتب المستخدمون باللهجة بينما تُكتب معظم المراجع بالفصحى. الاستراتيجيتان العمليتان:

  • إعادة صياغة اللهجة إلى الفصحى عند الاستعلام باستخدام نموذج مضبوط للتعليمات.
  • الاسترجاع بفهرسين: فهرس على النص الأصلي وآخر على نسخة مُطبَّعة بالفصحى، ثم دمج النتائج.

٣. تمثيلات متّجهة تفهم العربية

اختر نموذج تمثيلات ذا تدريب حقيقي على العربية — مثل E5 متعدّد اللغات وBGE-M3 وCohere multilingual v3 وtext-embedding-3-large من OpenAI. قيِّم على بياناتك عبر مجموعة استعلامات ووثائق مرجعية. مهام MTEB العربية مفيدة كنقطة بداية لكنها لا تغني عن التقييم في مجالك.

٤. خط أنابيب RAG عربي بسيط

  1. الاستيعاب: تطبيع النص، ثم تقطيعه إلى مقاطع ٣٠٠–٥٠٠ رمزًا مع تداخل ١٠–٢٠٪، وحفظ النسختين الخام والمطبَّعة.
  2. التمثيل: توليد متجهات للمقطع المطبَّع وتخزينها في قاعدة متجهات (pgvector أو Qdrant أو Pinecone).
  3. إعادة كتابة الاستعلام: إن كان الاستعلام لهجيًا فأعِد صياغته إلى الفصحى ووسِّعه ببديلين إلى ثلاثة.
  4. استرجاع هجين: BM25 على النص الخام مع بحث متّجهي على النص المطبَّع، ثم دمج بترتيب متبادل (RRF).
  5. إعادة ترتيب أفضل ٢٠–٥٠ نتيجة بمُعيد ترتيب يدعم العربية مثل BGE-Reranker-v2-M3.
  6. التوليد: صِغ التعليمات بالعربية، واقتبس المقاطع حرفيًا، واطلب من النموذج أن يجيب بنفس المستوى (فصحى/لهجة) الذي سُئل به.

٥. التقييم

ابنِ مجموعة تقييم صغيرة (١٠٠–٣٠٠ بندًا) باللهجات التي يكتب بها مستخدموك فعلًا. قِس الاسترجاع (Recall@k وnDCG) وأمانة الإجابة (هل كل ادعاء مدعوم بمقطع؟) وجودتها بحكم متحدّث أصلي. حكم النماذج على النماذج مفيد لكن راجعه يدويًا لأن جودته في العربية أدنى منها في الإنجليزية.

٦. أخطاء شائعة

  • خلط الأرقام العربية واللاتينية دون تطبيع.
  • ضياع اتجاه علامات الترقيم عند دمج المقاطع؛ اعرض دائمًا بـ dir="rtl".
  • التقطيع على النقطة فقط، مع أن العربية تُكثر من "،" و"؛".
  • توقّع إجابات عربية جيدة من تعليمات نظام مكتوبة بالإنجليزية.

كيف نطبّق ذلك في داماسول

نستخدم هذه الأنماط داخل مشروعي (ذكاء أعمال للروّاد العرب)، ووكيلي(وكيل قانوني عربي أولًا)، وأواعينا (تجارة تحادثية بالعربية). لكل منتج تغطيته اللهجية الخاصة، ومجموعة تقييمه، وأنبوب إعادة ترتيبه — لأن النموذج متعدّد اللغات العام لا يكفي لخدمة العالم العربي بجودة حقيقية.

نبني معك ذكاءً اصطناعيًا عربيًا فعّالًا

فريق داماسول متخصّص في تطبيق نماذج اللغة، الوكلاء، والاسترجاع المعزّز للسياق العربي. تواصل معنا لمناقشة حالتك.

تواصل معنا