الجلسة ١ — الخريطة: اللسانيات الحاسوبية كحقل بحثي | أكاديمية مترجم
أكاديمية مترجم سلسلة الدراسات العليا جلستان مكثفتان
SEMINAR 01 / 02

الخريطة: اللسانيات الحاسوبية كحقلٍ بحثي

النقاط المضيئة خلف هذا العنوان ليست زخرفة — إنها محاكاة لِما يحدث للغة داخل النموذج: كلماتٌ تصير نقاطًا في فضاء، وقربُها من بعضها هو «المعنى». هذه الجلسة خريطة ذلك الفضاء: صراعاته الفكرية، ومشكلاته المفتوحة، وموقع العربية — وموقعكم — منه.

🎓 المستوى: تمهيدي للدراسات العليا
⏱ المدة: ٩٠ دقيقة
📖 المرجع: Jurafsky & Martin (3rd ed.)

مخرجات الجلسة — ستغادرون وبحوزتكم:

  • موقفًا مُسبَّبًا من السؤال المؤسِّس: ما الذي «تفهمه» النماذج اللغوية فعلًا؟
  • خريطة مهام الحقل مصنّفةً بحالتها البحثية: محلولة / جزئية / مفتوحة.
  • آليات إنتاج المعرفة في الحقل: المؤتمرات، والـ preprints، والـ benchmarks.
  • جردًا محدَّثًا لمشهد الـ Arabic NLP حتى ٢٠٢٦: النماذج السيادية، والمختبرات، والفجوات.

كيف تقرأ هذه الصفحة

  • الصفحة تفاعلية: اضغط أزرار الترشيح في لوحة الحالة، وراقب العناصر المتحركة — ليست زخرفة، كلٌّ منها يشرح فكرة.
  • كلما رأيت صندوقًا بعنوان «جرّبها بنفسك» أو «افعلها الآن»، توقّف ونفّذ فعلًا — دقيقتان هناك تساويان صفحةً من القراءة.
  • افتح دفترًا جانبيًا وسجّل فيه كل سؤالٍ يخطر لك ولم تجد جوابه هنا. هذا الدفتر هو نواة موضوع رسالتك، وسنعود إليه في الجلسة الثانية.
۰

الافتتاحية: لغزان بدل التعريف

نظامٌ «يكتب» أطروحاتٍ بلغة سليمة ويترجم بين مئة لغة. لنختبره في مهمتين من عُدّة طالبِ السنة الأولى بكلية الألسن — وليكن المبدأ المنهجي واضحًا من البداية: نحن لا نصطاد أخطاء؛ نحن نرسم حدود قدرةٍ، وهذا عملٌ علمي.

LIVE PROBE 1 — التشكيل تحت الالتباس
PROMPT ←
اضبط بالشكل التام: «عرض المدير خطة العمل على مجلس الإدارة الذي عقد أمس»
← نمط إخفاقٍ متكرر — جرّب الطلب نفسه على أي نموذج وقارن النتيجة
عَرَضَ المُدِيرُ خُطَّةَ العَمَلِ عَلَى مَجْلِسِ الإِدَارَةِ الَّذِي عَقَدَ أَمْسِ
LIVE PROBE 2 — الإحالة
PROMPT ←
«سلّم المحامي الموكّلَ المستنداتِ ثم شكرَه» — على مَن تعود الهاء في «شكره»؟ علّل.
← نمط الإجابة الشائع
الهاء تعود على المحامي — بثقةٍ تامة، ودون الإشارة إلى أن الجملة تحتمل الوجهين وأن الترجيح تداوليٌّ لا نحوي

اللغز الأول: «عَقَدَ» مبنيًا للمعلوم يجعل المجلس فاعلَ العقد — والأرجح «عُقِدَ» (انعقد اجتماعُه). قرارٌ يتطلب تحليلًا نحويًا‑دلاليًا‑إحاليًا متزامنًا، والنموذج حسمه دون أن «يتردد».

اللغز الثاني أعمق: المشكلة ليست في اختيار المرجع، بل في الثقة الزائفة — إخفاءُ الالتباس أخطر معرفيًا من الخطأ الصريح، لأنه يوهم المستخدم بيقينٍ لا وجود له. قياس «معايرة الثقة» (calibration) في النماذج مجالٌ بحثي قائم بذاته.

الخلاصة المؤسِّسة: الفجوة بين الطلاقة (fluency) والكفاءة اللغوية العميقة هي المساحة البحثية التي يعمل فيها هذا الحقل اليوم — وهي المساحة التي ستُكتب فيها رسائلكم.

جرّبها بنفسك — أول تجربة بحثية لك

افتح أي نموذج لغوي الآن، واطلب منه اللغزين بنصّهما. ثلاثة احتمالات، وكلّها مفيدة لك:

أخطأ: رأيتَ الفجوة بعينك — سجّل الخطأ حرفيًا في دفترك.
أصاب: نتيجة أثمن. أعد الطلب بصياغةٍ مختلفة قليلًا («شكّل الجملة» بدل «اضبطها بالشكل») وراقب هل تبدّل الناتج. تبدّلُ الإجابة مع ثبات المعنى ظاهرةٌ اسمها عدم الثبات (robustness)، وهي بذاتها موضوع أوراقٍ منشورة.
أصاب وثبت: جرّب جملةً أصعب من عندك، فأنت الآن تصمّم اختبارًا — وهذا بالضبط ما يفعله الباحثون.

1

ما هذا الحقل؟ ولماذا العربية تحديدًا؟ وبأيّ كتابٍ نبدأ؟

رأيتَ المشكلة في اللغزين أعلاه؛ الآن نُسمّي الحقل الذي يدرسها، ونبيّن لماذا موقعُك فيه — بوصفك عربيًا — موقعٌ نادر، وبأيّ مرجعٍ تبدأ رحلتك فيه.

١. التعريف — ثلاثة تعريفات لا واحد

في العلوم الشابة لا يوجد تعريفٌ واحد مقدَّس، بل تعريفاتٌ لكلٍّ منها مدرسة. وأول ما يميّز طالب الدراسات العليا أنه يسأل «مَن عرّف؟» قبل أن يسأل «ما التعريف؟». إليك الثلاثة بترتيبٍ مقصود:

التعريف المؤسسي — جمعية اللسانيات الحاسوبية (ACL)

اللسانيات الحاسوبية هي الدراسة العلمية للغة من منظورٍ حاسوبي؛ ويُعنى الباحث فيها ببناء نماذج حاسوبية للظواهر اللغوية المختلفة — نماذجَ إمّا قائمةً على المعرفة (مصنوعة يدويًا) أو مقودةً بالبيانات (إحصائية/تجريبية).

لماذا نبدأ به؟ لأنه تعريف الجمعية العلمية الأم للحقل، وهي التي تنظّم مؤتمر ACL وتُصدر دورية Computational Linguistics. ولاحظ تفصيلًا تاريخيًا يعنيك مباشرةً: الجمعية تأسست عام ١٩٦٢ باسم «جمعية الترجمة الآلية واللسانيات الحاسوبية» — أي أن هذا الحقل وُلد من رحم مشكلة ترجمة. تخصّصك ليس ضيفًا عليه؛ هو في صميم نشأته.

إطار الكتاب المرجعي — Jurafsky & Martin

لا يفصل الكتاب بين التخصصات الثلاثة، بل يعرضها بوصفها مجالًا واحدًا موحّدًا: معالجة اللغة الطبيعية، واللسانيات الحاسوبية، والتعرف على الكلام — تُقرأ جميعًا اليوم من خلال النماذج اللغوية.

والدليل في العنوان نفسه: An Introduction to Natural Language Processing, Computational Linguistics, and Speech Recognition with Language Models. إضافةُ عبارة «مع النماذج اللغوية» في الطبعة الثالثة ليست تحريرًا شكليًا — إنها إعلان موقف: النماذج اللغوية صارت العدسة التي يُقرأ بها الحقل كله.

التعريف الإجرائي — الذي نعتمده في هذه السلسلة

اللسانيات الحاسوبية هي الحقل الذي يحوّل المعرفة اللغوية إلى تمثيلاتٍ وإجراءاتٍ قابلة للحساب، ثم يستثمر ذلك في اتجاهين: بناء أنظمة تعالج اللغة، واختبار فرضياتنا عن اللغة نفسها.

فائدته لك: يوضّح أن أمامك مسارين — مسارًا يتجه إلى الصناعة (أبني نظامًا يعمل)، ومسارًا يعود إلى العلم (أفهم اللغة أعمق). والتقاطع بينهما هو أخصب مكانٍ للبحث.

فرقٌ لا بد أن تضبطه من اليوم الأول

المصطلحالسؤال المركزيمثال
Computational Linguistics
لسانيات حاسوبية (علم)
كيف تساعدني النمذجة الحاسوبية على فهم اللغة؟نمذجة الصرف العربي لتفسير كيف يولّد المتحدث آلاف الصيغ من جذرٍ واحد
Natural Language Processing
معالجة اللغات الطبيعية (هندسة)
كيف أبني نظامًا يشتغل على اللغة؟نظام يصنّف شكاوى العملاء أو يترجم عقدًا
Speech Technology
تقنيات الكلام
كيف أتعامل مع اللغة المنطوقة؟نظام يحوّل تسجيلًا صوتيًا إلى نص

القاعدة المختصرة: إن بدأ السؤال بـ«لماذا اللغة هكذا؟» فأنت في اللسانيات الحاسوبية؛ وإن بدأ بـ«كيف أجعل النظام يفعل هذا؟» فأنت في الـ NLP. وأجود الأبحاث اليوم تسأل السؤالين معًا.

٢. لماذا دراسته في العربية تحديدًا؟ — خمسة أسباب

السبب الأول: العربية «مختبرٌ علمي» لا مجرد لغة هدف

أربع خصائص تجعل العربية حالةً اختباريةً قاسية لأي نظرية حاسوبية: الصرف القالبي (جذر متقطّع + وزن، بخلاف الإلصاق الخطي في الإنجليزية)، وغياب التشكيل (الرسم الواحد يحتمل قراءاتٍ عدة — انظر «علم» في القسم التالي)، والازدواجية اللغوية (فصحى للكتابة وعاميات للكلام)، واللواصق التي تجعل «حدّ الكلمة» مفهومًا ملتبسًا. أي نظريةٍ تصمد أمام العربية نظريةٌ أقوى — ولهذا تُعَدّ نتائج الأبحاث العربية مساهمةً عامة في الحقل لا محليةً فحسب.

السبب الثاني: فجوة الموارد = مساحة إسهامٍ حقيقية

في اللغات الغنية بالموارد صار كل شيءٍ تقريبًا مبنيًا، ومساهمة الباحث الجديد تُقاس بكسور النقطة المئوية. في العربية — وخصوصًا لهجاتها — لا تزال هناك موارد لم تُبنَ بعد: مدوّنات موسومة، ومعايير تقييم، ومجموعات تحدٍّ. أن تكون أول من يبني موردًا أثمن — وأكثر استشهادًا — من أن تكون الألف في تحسين نموذج.

السبب الثالث: لحظة تاريخية — النماذج العربية السيادية

خلال السنوات الأخيرة دخلت المنطقة عصر بناء نماذجها الوطنية (Jais في الإمارات، ALLaM في السعودية، Fanar في قطر، وغيرها). هذه المشاريع تستهلك خبرةً لغوية بشرية بكثافة: بناء بيانات التدريب، والوسم، وتصميم معايير التقييم، واختبار السلوك اللغوي والثقافي. الطلب على من يعرف العربية من الداخل في ذروته الآن — لا بعد عشر سنوات.

السبب الرابع: أنت تملك ما يصعب تعويضه

المهندس يحتاج سنواتٍ ليستوعب الصرف العربي وأحكام الإعراب وفروق اللهجات؛ وأنت تحتاج شهورًا لتتقن أدواته الأساسية. المعادلة في صالحك — بشرط أن تتحرك. وتذكّر ما سترى في القسم الأخير: حتى الـ tokenizer صار يُبنى اليوم على وعيٍ صرفي، وهذه معرفةٌ لسانية لا برمجية.

السبب الخامس — وهو الأعمق: مَن يبني الأداة يرسم حدود ما يُرى

كل قرارٍ تقني في معالجة العربية هو قرارٌ لغوي مُقنَّع: أيّ تطبيعٍ نطبّق؟ أيّ لهجةٍ نُدرج؟ أيّ معيارٍ نقيس عليه؟ إن لم يتّخذ هذه القرارات من يعرف العربية، اتّخذها من لا يعرفها — وستُمثَّل لغتنا رقميًا بقراراتِ غيرنا. المسألة ليست فرصةً مهنية فحسب؛ فيها بُعدٌ يخصّ من يملك تمثيل لغته في الفضاء الرقمي.

٣. الكتاب المرجع — من أين تبدأ؟

المرجع القياسي عالميًا

Speech and Language Processing — Daniel Jurafsky & James H. Martin

3rd edition · مسوّدة مجانية كاملة على موقع المؤلفَين بجامعة ستانفورد

هذا هو الكتاب الذي يُدرَّس منه في برامج الماجستير حول العالم، ويُشار إليه اختصارًا بـ«J&M». ثلاث ميزات تجعله خيارك الأول:

  • مجاني ومتاح بالكامل — فصولًا بصيغة PDF، ومعها شرائح عرضٍ جاهزة لمعظم الفصول يسمح المؤلفان باستخدامها في التدريس.
  • يُحدَّث باستمرار — الطبعة الثالثة أُعيد بناؤها لتستوعب عصر النماذج اللغوية، وصارت في مجلدين: الأول عن النماذج اللغوية، والثاني عن وسم البنية اللغوية (الصرف والنحو والدلالة والإحالة والخطاب).
  • يجمع النظرية بالتطبيق — يشرح الظاهرة اللغوية أولًا ثم نمذجتها الحاسوبية، وهو ترتيبٌ يناسب القادم من اللسانيات لا العكس.
خطة قراءةٍ عملية — لا تبدأ من الفصل الأول ثم تستسلم
الترتيبالفصللماذا هنا
١Ch. 2 — الكلمات والتقطيعأول أدواتك العملية: التعبيرات النمطية، وتطبيع النص، والتقطيع. تطبيقه على العربية مباشر
٢Ch. 3 — نماذج N-gramأول إجابة رياضية عن سؤال «ما احتمال هذه الجملة؟» — وكل ما بعده مبنيٌّ عليه
٣Ch. 5 — التمثيلات المتجهيةالفصل المفصلي: كيف يصير المعنى أرقامًا. وأساسه النظري لسانيٌّ خالص (الفرضية التوزيعية)
٤Ch. 6 — الشبكات العصبيةالأساس الذي تُبنى عليه بنية الـ Transformer لاحقًا

تحذير من خطأ شائع: لا تقفز إلى فصول الـ Transformers والنماذج الضخمة مباشرةً لأنها «الموضوع الساخن». من يبني الأساس يفهم البناء؛ ومن يبدأ من القمة يحفظ مصطلحاتٍ دون أن يمتلكها.

ومعه — ثلاثة مصادر مصاحبة

ACL Anthology: أرشيف أوراق الحقل كاملًا ومجانًا — مكتبتك البحثية.
وثائق أدوات العربية (مثل CAMeL Tools): تجمع بين الشرح النظري والتطبيق العملي على العربية.
ورقة مسحية حديثة عن Arabic NLP من الـ Anthology أو arXiv: تختصر عليك سنواتٍ في رسم خريطة ما أُنجز وما لم يُنجز.

2

لماذا هذا الحقل صعب؟ ثلاثة أحرف تكفي للجواب

قبل الخوض في تاريخ الحقل وفلسفته، دليلٌ حسّي واحد على حجم المشكلة. أمامكم ثلاثة أحرف — رسمٌ كتابي واحد يحمل ستّ هويات لغوية كاملة، ولا شيء يفصل بينها إلا حركاتٌ غائبة عن النص المكتوب:

1 / 6
عِلْم
المعرفة — knowledge
NOUN · اسم
تتبدّل تلقائيًا — والمُشكِّل الآلي عليه أن يختار من السياق وحده

الآن الأرقام التي تجعل من هذه الظاهرة كارثةً حاسوبية: الفعل الإنجليزي له في المتوسط ٤–٥ صيغ كتابية؛ الجذر العربي الواحد يولّد آلاف الصيغ بالاشتقاق والإلصاق — وكل صيغةٍ قد تحتمل قراءاتٍ عدة بلا تشكيل. النتيجتان الحاسوبيتان: تناثر البيانات (معظم الصيغ نادرة في أي مدونة مهما ضخُمت) والغموض المضاعف (على المحلل أن يختار قراءةً من بينها بالسياق وحده).

والكلمة الواحدة قد تكون جملةً كاملة — شاهدوا بأنفسكم:

أَفَاسْتَسْقَيْنَاكُمُوهَا؟
أاستفهام فَـعطف اسْتَسْقَىالجذر س‑ق‑ي بصيغة الاستفعال نَاضمير الفاعل كُمُومفعول أول هَامفعول ثانٍ
= «فهل طلبنا منكم أن تسقونا إيّاها؟» — ست وظائف نحوية في رسمٍ متصل واحد. أي نظامٍ يعالج العربية عليه أن يؤدي هذا التفكيك قبل أن يبدأ «الفهم» أصلًا. (اضغطوا الكلمة لإعادة العرض بتحديث الصفحة)
لماذا نبدأ الجلسة بهذا؟

لأن هذين العرضين يعيدان تعريف موقعكم: كل صعوبةٍ رأيتموها الآن تعني أن الحلول المبنية للإنجليزية تعمل أسوأ على العربية — وأن مَن يعرف العربية من الداخل (صرفَها ونحوَها ولهجاتِها) يملك أندرَ مهارةٍ في هذا الحقل، لا أكثرَها فائضًا. سنعود لهذه النقطة بأدلةٍ مؤسسية في ختام الجلسة.

3

سبعون عامًا في موجتين ونصف — ثم الصراع الذي لم يُحسم

تاريخ الحقل ليس تعاقُب تقنيات بل صراعٌ إبستمولوجي حول سؤالٍ واحد: ما الذي يُعَدّ «تفسيرًا علميًا» للغة؟ راقبوا الخيط الذهبي وهو يتحول تيليًا (أخضر البحر) عند لحظة التحول العصبي:

WAVE 1 · RULE-BASED · القواعد اليدوية
1954

تجربة Georgetown–IBM: الوعد الأول

أول عرضٍ علني للترجمة الآلية: نيّفٌ وستون جملة من الروسية إلى الإنجليزية، بمعجمٍ من ٢٥٠ كلمة وست قواعد نحوية فقط. الصحافة بشّرت بحل الترجمة الآلية «خلال ثلاث إلى خمس سنوات» — وأخذت الرحلة ستين عامًا. درسٌ افتتاحي في تواضع التنبؤ داخل هذا الحقل.

1966

الصدمة المزدوجة: تقرير ALPAC وبرنامج ELIZA

تقرير ALPAC الحكومي الأمريكي أعلن تعثّر الترجمة الآلية وقطع تمويلها — أول «شتاءٍ» للحقل. وفي العام نفسه بنى Weizenbaum برنامج ELIZA: محاكي معالجٍ نفسي يعمل بقواعد استبدالٍ نصية بسيطة، فتعلّق به الناس عاطفيًا حتى فزع مبتكرُه. أول درسٍ موثّق في قوة إيهام الطلاقة — وهو الدرس الذي عاد بقوةٍ مضاعفة عام ٢٠٢٢.

WAVE 2 · STATISTICAL · الثورة الإحصائية
~1990

مشروع IBM Candide: الانقلاب المنهجي

بدل كتابة قواعد الترجمة يدويًا: دَع الآلة تتعلّمها من ملايين الجمل المترجمة فعلًا — محاضر البرلمان الكندي ثنائية اللغة. الاحتمال بدل القاعدة، والمدونة بدل الحدس. ومن هذا العصر المقولة المنسوبة إلى Jelinek عن تحسّن الأنظمة كلما قلّ الاعتماد على اللغويين — سنقلبها رأسًا على عقب في ختام الجلسة.

WAVE 3 · NEURAL / LLMs · العصبية والنماذج الضخمة
2013

word2vec: الكلمة تصير متجهًا

فريق Mikolov في Google يحوّل «معنى» الكلمة إلى متجه أرقامٍ متعلَّمٍ من سياقاتها — التجسيد الرقمي لمقولة اللساني Firth: تُعرَف الكلمة بصحبتها. لأول مرة «تعرف» الآلةُ أن ملكًا أقرب إلى سلطانٍ منه إلى ملعقة، دون أن يخبرها أحد.

2017

ورقة Attention Is All You Need: ميلاد الـ Transformer

البنية التي يقوم عليها كل ما تلاها — BERT وGPT وClaude والنماذج العربية السيادية جميعًا. جوهرها الذي يهمّكم: آلية «الانتباه» تُقدّر ديناميكيًا أيُّ الكلمات في السياق أهمّ لتفسير كلٍّ منها — نمذجةٌ صريحة للاعتماد السياقي الذي تعرفونه لسانيًا.

2022

ChatGPT: الحقل يغادر المختبر

النموذج اللغوي يصير منتجًا جماهيريًا، ومرحلة «ما بعد التدريب» بالتقييم البشري (RLHF) تصير صناعةً قائمة — صناعةٌ عمودُها الفقري أحكامٌ لغوية بشرية. وتذكّروا ELIZA ١٩٦٦: سؤال «إيهام الطلاقة» عاد، لكن على نطاق مئات ملايين المستخدمين.

المناظرة الكبرى: تشومسكي × نورفيغ (٢٠١١) — ولمّا تُحسم

VS

المعسكر العقلاني

Noam Chomsky — MIT
النجاح الإحصائي في محاكاة السلوك اللغوي ليس فهمًا علميًا — إنه وصفٌ بلا نظرية.

◂ هدف العلم تفسيرُ الكفاءة اللغوية بوصفها نظامًا معرفيًا، لا التنبؤ بالأداء السطحي.
◂ النموذج الذي «ينجح» دون أن نفهم لماذا، كفيزياء تتنبأ بلا قوانين.
◂ موقفه من الـ LLMs اليوم امتدادٌ مباشر: براعةٌ هندسية، لا نظريةَ لغة.

المعسكر التجريبي

Peter Norvig — Google Research
اللغة الحقيقية احتماليةٌ غامضة متغيرة — والنماذج الاحتمالية وصفُها الأصدق لا حيلةٌ هندسية.

◂ معيار النظرية العلمية قدرتها التنبؤية على بياناتٍ لم ترها — معيارٌ راسخ في كل العلوم.
◂ الجمل «المثالية» تجريدٌ؛ العلم يبدأ من اللغة كما تقع فعلًا.
◂ ردّه المكتوب على تشومسكي (On Chomsky and the Two Cultures) قراءةٌ إلزامية في هذه السلسلة.

الجولة المعاصرة: هل «تفهم» النماذج؟ — خذوا مواقعكم

الموقفالحجة المركزيةمدخل القراءة
«الببغاء العشوائي»
Bender وزميلاتها
النموذج يخيط أنماطًا سطحية من بيانات تدريبه دون قصدٍ أو إحالة — الطلاقةُ وهمُ فهمٍ نُسقطه نحن عليهورقة Stochastic Parrots (FAccT 2021)
حجة الأخطبوط
Bender & Koller
تجربة فكرية: كائنٌ يعترض كابلًا بحريًا ويُتقن أنماط المحادثة دون أي صلةٍ بالعالم — أيّ «فهمٍ» هذا؟ الشكل وحده لا يبلغ المعنىClimbing towards NLU (ACL 2020)
الموقف المضاد: التمثيلات الناشئةتجارب الاستنطاق (probing) تكشف داخل النماذج تمثيلاتٍ بنيوية حقيقية — نحوًا وإحالةً وأنساقًا شبيهة بنماذج عالمٍ جزئية. القصة أعقد من ببغاءأدبيات probing/interpretability — سنمارسها بأيدينا في الجلسة الثانية
لماذا يعنيكم هذا الجدل أنتم تحديدًا؟

لأنه جدلٌ لساني-فلسفي في جوهره (ما المعنى؟ ما الإحالة؟ ما الكفاءة؟) يجري في قلب حقلٍ هندسي يفتقر غالبًا إلى عُدّتكم النظرية — ولاحظوا أن أشهر أوراق النقد في العقد الأخير كتبتها لسانِيةٌ (Emily Bender). أنتم لا تدخلون الحقل ضيوفًا؛ تدخلونه وقد احتاج أدواتِكم بالاسم.

4

خريطة المهام كلوحة حالةٍ بحثية — رشِّحوها بأنفسكم

في مستوى الدراسات العليا لا يكفي جدول «المستويات والمهام»؛ المهم العمود الثالث: الحالة البحثية. الباحث لا يذهب حيث الأخضر — يذهب حيث الأصفر والأحمر:

POS Tagging — الوسم الصرفي‑النحوي (للإنجليزية)
دقة تتجاوز ٩٧٪ على المعايير القياسية منذ سنوات — لم يعد موضوع رسالةٍ بذاته
محلولة تقريبًا
Spell Checking — التدقيق الإملائي للغات الغنية بالموارد
ناضجٌ تجاريًا؛ يبقى مفتوحًا نسبيًا للهجات وللنصوص التراثية
محلولة تقريبًا
Machine Translation — الترجمة الآلية
قويةٌ بين اللغات الغنية بالموارد؛ تتراجع في الأزواج الشحيحة والمصطلح التخصصي واتساق الوثائق الطويلة
جزئية
Parsing — الإعراب الآلي
جيدٌ على نصوص الأخبار؛ يتدهور خارج النطاق وفي اللغات الحرّة الرتبة كالعربية
جزئية
Coreference — حلّ الإحالة
تقدمٌ كبير للإنجليزية؛ الضمائر المتصلة العربية تحدٍّ قائم — تذكّروا اللغز الثاني في الافتتاحية
جزئية
Arabic Diacritization — استرجاع التشكيل آليًا
حتى النماذج الضخمة تُخفق في الالتباسات المركّبة — عايشتموها في مُشكِّل «علم» أعلاه
مفتوحة
Dialect MT — ترجمة اللهجات العربية
بيانات موازية شبه معدومة؛ نماذج لهجاتٍ ناشئة (مثل Atlas-Chat للدارجة المغربية) تؤكد أن الباب مفتوح
مفتوحة
Pragmatics — التداولية الحاسوبية
القصد والتهذيب والسخرية عبر الثقافات: تتعثر فيها أقوى النماذج — أفقٌ بحثي واسع
مفتوحة
Arabic LLM Evaluation — تقييم النماذج عربيًا
معايير كثيرة مترجمةٌ عن الإنجليزية وتُخطئ الخصوصية الثقافية؛ معايير عربية أصيلة (ArabicMMLU، ACVA وغيرها) بدأت تسدّ الفجوة — ولم تُغلقها
مفتوحة
تحذير إبستمولوجي — ماذا تعني «محلولة»؟

«محلولة» = الأداء على المعايير المتاحة تشبّع — عبارةٌ محمّلة: مَن بنى المعيار؟ على أيّ لغةٍ وأيّ نطاق؟ تشبّع المعيار قد يعني استنفادَ المعيار لا حلَّ المشكلة. نقدُ المعايير — لا سيما العربية منها — مساهمةٌ بحثية منشورة بذاتها، وسنعود إليه عمليًا في الجلسة الثانية.

5

سوسيولوجيا الحقل: كيف تُنتَج المعرفة هنا؟

هذا لا يُدرَّس في الكتب، وجهلُه يكلّف الوافد من العلوم الإنسانية سنةً من الارتباك. أولًا: أرقامُ الحيّ الذي تنتقلون إليه —

0+
ورقة مفتوحة الوصول في ACL Anthology — مكتبتكم الجديدة، مجانًا بالكامل
0%~
نسبة القبول النمطية في المؤتمرات الكبرى — تنافسٌ من طراز أفضل الدوريات
0 مليون+
متحدثٍ بالعربية — سوق «اللغة الشحيحة الموارد» الأعلى قيمةً في العالم
0 تريليون
توكِن تقريبًا في بيانات تدريب ALLaM السعودي — حجم الرهان السيادي على العربية

الصدمة الأولى: المؤتمر أهم من الدورية

في حقولكم الأم، الدورية المحكّمة ذروةُ النشر والمؤتمر هامش. هنا العكس: أوراق المؤتمرات الكبرى كاملةُ التحكيم وهي العملة الأكاديمية الأولى:

المستوىالاسمما يعنيكم
قمة الحقلACL · EMNLP · NAACLورقةٌ واحدة هنا بوابةٌ لأي برنامج دكتوراه في العالم
الموارد والتقييمLREC · COLINGالأقرب لمزاج اللسانيين: مدوناتٌ ومعاييرُ وتوصيف موارد
بيت العربيةArabicNLP (WANLP سابقًا)المؤتمر المتخصص بالعربية — نقطةُ نشرِكم الأولى الواقعية

الصدمة الثانية: دورة حياة الورقة تمرّ بـ arXiv

# دورة الحياة النمطية: draft → arXiv preprint (يُقرأ ويُستشهد به فورًا) → مراجعة (ARR / OpenReview — علنية غالبًا!) → مؤتمر → ACL Anthology للأبد # الإيقاع بالأسابيع لا بالسنوات — صادمٌ لمن اعتاد دورياتٍ تنتظر عامين

الصدمة الثالثة: الـ benchmark ساحةُ النزال

الادعاء العلمي لا يُحسم بالحجاج بل بالقياس العلني القابل للتكرار: نموذجُك ضد خطوط الأساس على معيارٍ مشترك. ومن هنا خطورة سؤال «مَن يبني المعيار؟» — فمن يبنيه يرسم حدود ما يُرى. لاحظ الحلقة المكتملة: بناء المعايير يحتاج وسمًا لغويًا رشيدًا... وهذه صنعتُكم.

افعلها الآن — خمس دقائق تغيّر علاقتك بالمجال

افتح ACL Anthology الآن وابحث عن: Arabic diacritization. تصفّح أحدث ثلاث نتائج وسجّل عناوينها — هذه أول خطوةٍ في مراجعة أدبياتٍ حقيقية، وسنشرّح إحداها تشريحًا كاملًا في الجلسة الثانية.

6

مشهد الـ Arabic NLP حتى ٢٠٢٦ — جردٌ أمين ومحدَّث

لا تهويل ولا تهوين. الخبر الأهم الذي ربما فاتكم: العربية دخلت عصر «النماذج السيادية» — دولٌ تبني نماذجَها الوطنية باستثماراتٍ ضخمة، وكلُّها تتنافس على نُدرةٍ واحدة: خبراء اللغة.

النماذج العربية الكبرى — خريطة ٢٠٢٦

النموذجالجهةما يميّزه بحثيًا
Jais / Jais 2Inception (G42) — أبوظبيمن أوائل النماذج المبنية من الصفر للعربية؛ الجيل الثاني وصل فئة الـ 70B بأوزانٍ مفتوحة
ALLaMSDAIA / HUMAIN — السعوديةمشروع وطني بمشاركة مئات الخبراء وبيانات تدريبٍ من فئة تريليونات التوكِنز — نموذج «الرهان السيادي» الأوضح
Fanarقطر (بمشاركة QCRI)الأهم لكم: طوّر tokenizer واعيًا بالصرف اسمه MorphBPE — فكرة «التقطيع الصرفي» التي سنناقشها كموضوع رسالةٍ صارت منتجًا فعليًا
Falcon ArabicTII — أبوظبينماذج خفيفة تعمل على عتادٍ استهلاكي — مسار «الديمقراطية الحاسوبية» للعربية
Atlas-Chatمجتمع بحثي — المغربأول نماذج مفتوحة للدارجة المغربية — دليلٌ حي أن «فجوة اللهجات» تُسدّ بمبادراتٍ بحجم رسالة دكتوراه
اقرؤوا هذا الجدول قراءةَ باحثٍ عن وظيفة أيضًا

كل صفٍّ فيه فريقٌ يوظّف: بناءُ بيانات التدريب والتقييم لهذه النماذج يستهلك لسانيين بالعشرات — في الوسم، والتحكيم، وتصميم المعايير، والـ red teaming الثقافي واللغوي. المسار الأكاديمي والمسار المهني في هذا الحقل بابهما واحد.

البنية التحتية البحثية

الفئةالمواردتقييم صريح
التحليل الصرفي والتقطيعCAMeL Tools · Farasa · MADAMIRAناضجة وموثوقة للفصحى؛ أضعف على اللهجات
المدونات الموسومةPenn Arabic Treebank · مدونات UD العربيةموجودة لكنها أصغر بكثير من نظيراتها الإنجليزية — والوسم مكلف: فرصتكم
معايير التقييم العربيةArabicMMLU · ACVA · ArabLegalEvalموجةٌ جديدة من معايير عربية أصيلة — ونقدُها وتوسيعُها بابٌ بحثي مفتوح

مَن يعمل أين — عناوين تراسلونها فعلًا

CAMeL Lab

NYU Abu Dhabi

المرجع العالمي في المعالجة العربية: أدوات ومدونات ولهجات — برامجه وزياراته البحثية هدفٌ واقعي.

QCRI

قطر

وراء Farasa وأعمال اللهجات، وشريكٌ في Fanar — تدريبٌ وتعاون بحثي نشط.

فرق النماذج السيادية

الإمارات · السعودية · قطر

Jais وALLaM وFanar وFalcon — طلبٌ فعلي متصاعد على لسانيين للبيانات والتقييم.

الجامعات المصرية

القاهرة · الألسن · حلوان · الإسكندرية

مجموعات NLP متنامية — خيار الدراسات العليا الأقرب، مع إمكان تعاونٍ بحثي عن بُعد.

ختام الجلسة — قلبُ مقولة Jelinek

من «كاتب القواعد» إلى «مهندس المعرفة اللغوية ومُسائلها»

في الموجة الأولى كتب اللسانيُّ القواعدَ بيده؛ وفي الثانية قيل «كلما خرج لسانيٌّ تحسّن الأداء». واليوم انقلبت الآية على نحوٍ موثّق: النماذج تتعلم من بياناتٍ يصنعها ويقيّمها بشر، ومرحلة ما بعد التدريب قائمةٌ على أحكامٍ لغوية، والنماذجُ السيادية العربية توظّف اللسانيين بالاسم، وحتى الـ tokenizer صار يُبنى على وعيٍ صرفي (MorphBPE). دورُ اللساني لم يَعُد كتابة القواعد — بل هندسة المعرفة اللغوية التي تتغذى عليها النماذج، ومساءلتَها حين تدّعي ما لا تملك.

الواجب التمهيدي للجلسة الثانية مبنيٌّ على مهاجمة هذه الأطروحة أو الدفاع عنها — انظر التدريب الرابع.

7

تدريبات الجلسة الأولى

تدريب ١ — موقعك من المناظرة (١٠ دقائق — ناقشه مع زميل إن أمكن)

حجة الأخطبوط: مَن يتعلم الشكل وحده لا يبلغ المعنى. ونتائج الاستنطاق تُظهر تمثيلاتٍ بنيوية حقيقية داخل النماذج. صُغ موقفك في ثلاث جمل مستندًا إلى مفهومٍ واحد على الأقل من تراثك النظري (الكفاءة/الأداء، الدال/المدلول، القصدية...).

كيف تعرف أن موقفك متماسك؟ — لا إجابة نموذجية هنا عمدًا
أي موقفٍ مقبول بشرطين: (١) أن يفكك «الفهم» إلى مستوياتٍ (تمثيل بنيوي / إحالة / قصد) بدل معاملته كتلةً واحدة، (٢) أن يسمّي الدليلَ الذي قد يغيّر رأيه — فالموقف غير القابل للدحض ليس موقفًا علميًا. وهذان الشرطان هما نفسهما معيارا التحكيم في أي سيمنار دكتوراه.

تدريب ٢ — اقرأ لوحة الحالة قراءةَ باحث

اختر من اللوحة مهمةً «جزئية» ومهمةً «مفتوحة»، وأجب: لماذا الأولى أنسب لرسالة ماجستير والثانية أخطر عليها؟ وما «وحدة المساهمة» الواقعية في كلٍّ: مورد؟ معيار؟ تحسين نموذج؟ دراسة تحليلية؟

منطق الإجابة
الجزئية توفر بنيةً قائمة (بيانات + baselines + مقاييس) تجعل المساهمة قابلةً للقياس في مدة الماجستير. المفتوحة قد تبتلع سنواتٍ في بناء البنية وحدها؛ مدخلُها الواقعي: مساهمة موردٍ أو تقييم — ومفارقةٌ تستحق الحفظ: في اللغات الشحيحة، مدونةٌ موسومة متقنة يُستشهد بها أكثر من تحسين نموذجٍ بنقطة. ولاحظ أن Atlas-Chat بدأ من هذا الحجم تقريبًا.

تدريب ٣ — أول غوصة في الـ Anthology (منزلي، ٤٥ دقيقة)

ابحث عن مهمةٍ عربية تهمّك، واختر أحدث ورقتين، واملأ لكلٍّ بطاقةً من أربعة أسطر: (المشكلة — البيانات — المنهج — الرقم الرئيسي). لا يُطلب فهم كل التفاصيل؛ يُطلب تحديد مواضعها. أحضر البطاقتين للجلسة الثانية — سنبني عليهما التشريح الكامل.

تدريب ٤ — الواجب التمهيدي للجلسة الثانية (كتابي، فقرة)

قلنا إن دور اللساني تحوّل إلى «هندسة المعرفة اللغوية ومساءلتها». هاجِم الأطروحة أو دافع عنها من موقع تخصصك الدقيق، مبيّنًا: ما الذي يملكه تخصصك ولا تعوّضه فرق الهندسة ببساطة؟ وما الذي يجب أن تكتسبه أنت لتحتلّ الدور فعلًا لا شعارًا؟

8

قائمة قراءة الجلسة — بالأولوية

#المادةلماذا
١Jurafsky & Martin, 3rd ed. — Ch.1 (مجاني على موقع المؤلفَين)الخريطة القانونية للحقل
٢Norvig: On Chomsky and the Two Cultures of Statistical Learningأوضح عرضٍ للمعسكر التجريبي بقلم رأسه
٣Bender & Koller (ACL 2020): Climbing towards NLUحجة الأخطبوط من مصدرها — وصوتُ اللسانيين في قلب الحقل
٤ورقة مسحية حديثة عن Arabic LLMs من arXiv/الـ Anthologyخريطة تفصيلية لمشهد ٢٠٢٥–٢٠٢٦ الذي عرضناه
سلسلة الدراسات العليا في اللسانيات الحاسوبية — أكاديمية مترجم
الجلسة القادمة ← ٢: «الصنعة» — تشريح الورقة، ومثلث المنهج، وثلاث تجارب حية، وبوابة الدخول
أكاديمية مُترجم الترجمة في عصر الذكاء الاصطناعي

© 2026 جميع الحقوق محفوظة

Scroll to Top