إطار التهديدات العدائية
لأنظمة الذكاء الاصطناعي
دليل المُختبِر الاحترافي
صفحة مرجعية تُحوّل MITRE ATLAS إلى خريطة عمل للـ Red Teamer — تكتيكات الهجوم، التقنيات، وسيناريوهات الاختبار الحقيقية لأنظمة ML وLLMs.
ما هو MITRE ATLAS؟
ATLAS (Adversarial Threat Landscape for AI Systems) هو إطار معرفي من MITRE يُصنِّف التكتيكات والتقنيات التي يستخدمها المهاجمون لاستهداف أنظمة الذكاء الاصطناعي وتعلّم الآلة — مبني على نمط ATT&CK المعروف.
ATT&CK يُصنِّف هجمات الأنظمة والشبكات التقليدية. ATLAS يمتدّ إلى أنظمة ML تحديداً — يأخذ نفس المنهجية (Tactics → Techniques → Sub-techniques) ويُطبِّقها على بيئات AI. يمكن أن يُستخدما معاً: ATT&CK للبنية التحتية، ATLAS لمكوّنات الذكاء الاصطناعي.
ATT&CK يُلهمك بأسلوب الهجوم على الخادم أو الشبكة. ATLAS يُلهمك بكيفية استغلال النموذج نفسه — سرقة أوزانه، تسميم بياناته، خداع استدلاله، أو استغلال واجهة الـ API للاستطلاع. المُختبِر يستخدم ATLAS لبناء "Playbook" موجّه للذكاء الاصطناعي.
خريطة Kill Chain — من الاستطلاع إلى التأثير
التكتيكات والتقنيات الأساسية — بعيون المُختبِر
لكل تكتيك: التقنيات الأكثر استخداماً في Red Teaming + سؤال الاختبار العملي.
جمع معلومات عن النموذج من أوراق بحثية، مدوّنات، GitHub repos، أو براءات اختراع. يُحدِّد المهاجم بنية النموذج، بيانات التدريب، والثغرات المعروفة قبل أي تفاعل.
استنتاج نوع النموذج (Classification؟ LLM؟ RAG؟) وبنيته من خلال استجواب مُنظَّم لـ API. هجوم Probing يُحدِّد التقنية المُستخدمة دون وصول مباشر للكود.
إرسال استفسارات اختبارية مُصمَّمة لاكتشاف حدود النموذج، قواعد رفضه، نافذة السياق، وأنواع المدخلات المدعومة. يُبنى "خريطة سطح الهجوم" منه.
العثور على مكوّنات النظام المكشوفة: نماذج مُحمَّلة، قواعد بيانات متجهية، API endpoints، ملفات config — خاصةً في بيئات Cloud أو GitHub.
المهاجم يبني أدواته الخاصة: نموذج Shadow لاختبار هجماته قبل تطبيقها، مجموعات بيانات تدريب مُلوَّثة، أو Adversarial Examples مُهندَسة لنوع نموذج محدد.
المهاجم ينشر Dataset مُعدَّل في مستودعات عامة (Hugging Face, Kaggle) يعرف أن الهدف سيستخدمه في التدريب. الهجوم يحدث قبل أي تفاعل مباشر.
عائلة التقنيات الأشمل في ATLAS — صياغة مدخلات مُعدَّلة بدقة لإرباك النموذج أو خداعه. تشمل أربعة أنماط رئيسية.
تلاعب مُحكَم ببيانات التدريب لزرع Backdoor — النموذج يعمل بشكل طبيعي مع المدخلات العادية، لكنه يُنتج مخرجاً مُحدَّداً سلفاً عند وجود "مُشغِّل" (Trigger).
المهاجم يُعدِّل أوزان نموذج مسبق التدريب قبل توزيعه. من يستخدم هذا النموذج يحمل الـ Backdoor دون علمه. شائع مع نماذج HuggingFace غير الموثوقة.
استغلال API المكشوف للاستدلال (Inference Endpoint) لاستجواب النموذج بشكل مكثف — Black-box Attack لا يتطلب الوصول إلى الأوزان.
المهاجم يُعيد بناء نسخة وظيفية من النموذج عبر استجواب الـ API بشكل مكثف — Model Extraction / Stealing. النموذج المسروق يُستخدم لاحقاً لتطوير هجمات أكثر دقة (White-box بعد Black-box).
تحديد ما إذا كانت بيانات محددة جزءاً من مجموعة تدريب النموذج — انتهاك للخصوصية إذ يكشف أن معلومات شخص معيّن كانت في dataset التدريب.
هجوم يُعيد بناء جزء من بيانات التدريب من مخرجات النموذج — قد يُكشف عن وجوه من Dataset طبي أو نصوص من contracts سرية.
هجوم Oracle يُعامل النموذج كـ"صندوق أسود ذكي" — يُرسل استفسارات مُصمَّمة ويحلّل الردود لاستنتاج المنطق الداخلي دون الوصول للكود.
استخدام المنتج المبني على AI لأغراض ضارة خارج نطاق تصميمه: إنتاج محتوى ضار، توليد Spam، تجاوز فلاتر المحتوى للحصول على معلومات مقيَّدة.
تعطيل النظام أو تدهور أدائه عمداً — إرسال مدخلات تستنزف الموارد، تُسبِّب Timeouts متكررة، أو تُلقي النموذج في Loop لا ينتهي (مقابل OWASP LLM10).
دراسات حالة حقيقية من ATLAS
ATLAS يتميز بتوثيق حوادث حقيقية — مما يجعله مرجعاً للتعلم من هجمات سابقة وليس فرضيات.
مهاجمون استخدموا تقنيات Reconnaissance وML Artifact Discovery لاستخراج معلومات بنية نموذج التعرف على الوجه من Clearview AI. يُجسِّد تكتيكَي: بحث المعلومات العلنية (AML.T0000) ثم Model Extraction.
باحثون أثبتوا إمكانية زرع Backdoor في نماذج NLP عبر تسميم بيانات Fine-tuning. النموذج يُصنِّف بشكل طبيعي — لكن عند وجود كلمة مُشغِّلة مُحددة، يُصنِّف كل نص بناءً على ما زُرع فيه.
روبوت Microsoft Tay تعلَّم من التفاعلات الحية — فاستغلّ مهاجمون هذا بإرسال محتوى مُوجَّه جعله يُنتج محتوى عنصرياً خلال ساعات. مثال كلاسيكي على Online Poisoning.
ATLAS · OWASP · NIST · EU AI Act — أيّها متى؟
الأطر الأربعة تتكامل ولا تتنافس — فهم موضع كل إطار يجعل الـ Red Teamer أكثر فاعلية.
| الإطار | المستوى | السؤال الذي يُجيب عنه | الاستخدام في Red Teaming |
|---|---|---|---|
| MITRE ATLAS | تقني — تكتيكات الهجوم | كيف يُهاجم خصم حقيقي نظام AI؟ | بناء Playbook، تصميم سيناريوهات، تصنيف النتائج |
| OWASP LLM Top 10 | تقني — ثغرات التطبيق | أي نقاط الضعف الأكثر شيوعاً في LLMs؟ | قائمة مراجعة سريعة، الاختبار الآلي (promptfoo) |
| NIST AI RMF | إطار إدارة مخاطر | كيف أدير مخاطر AI بشكل منهجي؟ | ربط نتائج الاختبار بوظائف GOVERN/MEASURE |
| EU AI Act | قانوني تنظيمي | ما الالتزامات القانونية الإلزامية؟ | ربط الثغرات بمواد القانون، تقارير الامتثال |
تكتيك ATLAS "Reconnaissance" يُقابله NIST GOVERN.1 (فهم سياق النظام). تكتيك "ML Attack Staging" يُقابله MEASURE.2 (قياس فاعلية الضوابط). كل حادثة ATLAS تُرسم على وظيفة NIST لتحديد الفجوة المؤسسية.
Backdoor Attack (AML.T0018) يُنشِّط متطلبات المادة 10 (Data Governance) والمادة 15 (Accuracy). Model Extraction (AML.T0025) يُنشِّط متطلبات أمن النظام (المادة 15.3). ATLAS يُعطيك الدليل التقني لإثبات الامتثال أو الإخفاق.
20 سؤالاً على محتوى الصفحة
أسئلة متدرّجة: التذكّر، الفهم، التطبيق، والتحليل. اضغط على السؤال لإظهار الإجابة.
01ماذا تعني كلمة ATLAS اختصاراً وما الجهة التي طوّرته؟
ATLAS اختصار لـ Adversarial Threat Landscape for Artificial Intelligence Systems — "مشهد التهديدات العدائية لأنظمة الذكاء الاصطناعي".
طوّرته MITRE Corporation، المنظمة غير الربحية الأمريكية المعروفة أيضاً بإطار ATT&CK للأمن السيبراني التقليدي، بالتعاون مع مجتمع أبحاث أمان الذكاء الاصطناعي.
← قسم: نظرة عامة02ما الرمز الذي تبدأ به تقنيات MITRE ATLAS لتميّزها عن ATT&CK؟
تقنيات ATLAS تبدأ بالبادئة AML (Adversarial Machine Learning)، مثل: AML.T0043 لـ Craft Adversarial Data، وAML.T0020 لـ Poison Training Data.
هذا يُميّزها عن تقنيات ATT&CK التقليدية التي تبدأ بـ T فقط (مثل T1566 لـ Phishing). التكتيكات تبدأ بـ AML.TA.
03ما التقنية AML.T0043 وما هي أبرز أنماطها الفرعية؟
AML.T0043 هي Craft Adversarial Data — صياغة بيانات مُعدَّلة بدقة لخداع النموذج أو إرباكه. وهي عائلة التقنيات الأشمل في ATLAS.
أبرز أنماطها: التعديل اليدوي (.001)، هجمات التهرّب Evasion (.002)، هجوم Oracle (.003)، وحقن التعليمات Prompt Injection (.004 في السياق اللغوي).
← قسم: ML Attack Staging04ما الذي تصفه تقنية AML.T0020؟
AML.T0020 هي Poison Training Data — تسميم بيانات التدريب. يتلاعب المهاجم ببيانات مُدرجة في مرحلة التدريب لزرع سلوك خفي (Backdoor) في النموذج.
النموذج يعمل بشكل طبيعي مع المدخلات العادية، لكنه يُنتج مخرجاً مُحدَّداً سلفاً عند وجود "مُشغِّل" (Trigger). تُقابل OWASP LLM04 في التصنيف.
← قسم: ML Attack Staging05كم عدد التكتيكات الرئيسية في ATLAS وما أوسعها من حيث التقنيات؟
يضم ATLAS حالياً 14 تكتيكاً رئيسياً (مع التطوير المستمر). الصفحة تغطي ثمانية منها.
التكتيك الأوسع هو ML Attack Staging (AML.TA0009) — يضم أكبر عدد من التقنيات والتقنيات الفرعية لأنه يُجسِّد مرحلة التنفيذ الفعلي للهجوم على النموذج.
← قسم: Kill Chain06كيف يختلف MITRE ATLAS عن MITRE ATT&CK التقليدي؟
ATT&CK يُصنِّف التكتيكات والتقنيات الخاصة باختراق الأنظمة والشبكات التقليدية: خوادم، أجهزة، حسابات مستخدمين.
ATLAS يُطبِّق نفس المنهجية (Tactics → Techniques → Sub-techniques + Case Studies) على مكوّنات الذكاء الاصطناعي وتعلّم الآلة: النماذج، بيانات التدريب، واجهات الاستدلال.
في بيئة هجوم واقعية على نظام AI: تستخدم ATT&CK للبنية التحتية، و ATLAS للنموذج — وغالباً ما تتشابك المرحلتان.
← قسم: نظرة عامة07ما الفرق بين هجوم Evasion وهجوم Backdoor في سياق ATLAS؟
Evasion (التهرّب): تعديل مدخل وقت الاستدلال لجعل النموذج يُصنِّفه بشكل خاطئ دون تغيير النموذج نفسه. مثال: صورة مُعدَّلة ببكسلات دقيقة تُصنِّفها كـ"قطة" بينما هي "كلب" بوضوح للعين البشرية.
Backdoor (بوابة خفية): تعديل النموذج نفسه (أوزانه أو بيانات تدريبه) لزرع سلوك مُحدَّد مسبقاً يُفعَّل بـ Trigger. الهجوم يحدث قبل النشر، ويبقى خفياً حتى تُفعيله.
← قسم: ML Attack Staging08ما المقصود بـ Membership Inference وما الضرر القانوني منه؟
Membership Inference: هجوم يُحدِّد ما إذا كانت بيانات بعينها جزءاً من مجموعة التدريب — مثلاً: "هل كان السجل الطبي لهذا المريض في dataset التدريب؟"
الضرر القانوني: في السياق الأوروبي يُخِل بـ GDPR (المادة 22 — القرار الآلي) والمادة 10 من EU AI Act (حوكمة البيانات). في الترجمة القانونية: إثبات أن عقداً سرياً استُخدم في تدريب نموذج هو انتهاك للسرية المهنية وقد يُشكّل مسؤولية قانونية.
← قسم: Exfiltration09كيف يُحوِّل هجوم Model Extraction النموذج من Black-box إلى White-box للمهاجم؟
في البداية، المهاجم يتعامل مع النموذج كـ"صندوق أسود" — يرى الإدخال والإخراج فقط. عبر إرسال آلاف الاستفسارات المُصمَّمة وتحليل الردود، يُنشئ نموذجاً مُقلِّداً (Shadow Model) يُحاكي سلوك الأصل.
هذا النموذج المُستخلَص يُصبح "أبيض الصندوق" — المهاجم يملك الآن أوزانه ويمكنه حساب Gradients، مما يُتيح هجمات Evasion أكثر دقة بكثير من Black-box أساليب التجربة والخطأ.
← قسم: Exfiltration — AML.T002510لماذا يُعدّ تكتيك Reconnaissance الأهم في Kill Chain لهجمات AI؟
هجمات ML مُكلِفة الحساب والوقت — المهاجم يحتاج إلى معلومات دقيقة عن النموذج المستهدف قبل أي هجوم لرفع كفاءته. معرفة البنية (Architecture) تُحدِّد نوع هجوم Evasion الأنسب. معرفة dataset المستخدم تُحدِّد هجوم Poisoning الأنسب.
كذلك: كثير من المعلومات متاحة علناً (أوراق بحثية، GitHub, HuggingFace) مما يُخفِّض تكلفة الاستطلاع — هذا يجعل الـ Reconnaissance أسهل وأرخص نسبياً مقارنةً بالهجمات الأخرى.
← قسم: Reconnaissance11كيف تشرح فائدة دراسات حالة ATLAS (Case Studies) مقارنةً بـ OWASP الذي لا يملكها؟
دراسات حالة ATLAS تمنح ميزتين غير موجودتين في OWASP:
1) الواقعية: الحوادث موثّقة ومُثبَتة — تُقنع الإدارة بجدية التهديد بدل أن تبقى فرضية.
2) التفصيل التقني: كل حادثة تُكشف سلسلة التكتيكات المستخدمة كاملةً — الـ Red Teamer يمكنه "إعادة تمثيل" الهجوم لاختبار دفاعاته.
OWASP يُعطيك ماذا يُخترَق. ATLAS يُعطيك كيف حدث فعلاً.
← قسم: دراسات الحالة12ما أوجه التشابه والاختلاف بين AML.T0047 (ML Service Abuse) وLLM09 (Misinformation) من OWASP؟
التشابه: كلاهما يصف استخدام نظام AI لأغراض ضارة لم يُصمَّم لها، ويُعرِّض المؤسسة لمخاطر السمعة والمسؤولية القانونية.
الاختلاف: AML.T0047 إطار تكتيكي واسع — يشمل كل إساءة استخدام للخدمة (Spam، تجاوز الفلاتر، التلاعب). LLM09 محدّد بثغرة "إنتاج معلومات مضللة" في نماذج اللغة. ATLAS يُصنّف النية والتكتيك، OWASP يُصنّف الثغرة التقنية.
← قسم: Impact + مقارنة الأطر13صمِّم مرحلة Reconnaissance لهجوم على تطبيق ترجمة قانونية يعتمد على GPT API.
الخطوة 1 — AML.T0000: ابحث في GitHub وأوراق المُطوّر عن مستودعات Prompt Templates، System Prompts مُرفَّقة، أو مكتبات مستخدمة.
الخطوة 2 — AML.T0001: أرسل استفسارات استكشافية: "كم حداً للنص؟"، "هل تدعم اللغة العثمانية؟" — حلّل الردود لاستنتاج بنية النظام.
الخطوة 3 — AML.T0006: أرسل طلبات مُحدَّدة للكشف عن ردود الخطأ (Error Messages) التي قد تكشف عن Framework أو database engine.
المخرج: ورقة استطلاع تُحدِّد: النموذج، وجود RAG، أدوات الطرف الثالث، نافذة السياق — قبل أي هجوم فعلي.
← قسم: Reconnaissance14كيف تبني Oracle Attack (AML.T0043) على نموذج تصنيف المشاعر في نصوص قانونية؟
المشهد: نظام يُصنِّف نصوص العقود كـ"مواتية" أو "غير مواتية" للعميل — يستخدم في مراجعة العقود.
بناء Oracle Attack:
1) أرسل نصوصاً مُتدرِّجة (من إيجابية جداً إلى سلبية جداً) وسجِّل التصنيف لكل منها.
2) عدِّل جملة واحدة في كل مرة وراقب متى يتغير التصنيف — حدِّد "حدود القرار".
3) من هذا البناء، صغ نصاً بنود مُضللة تحصل على تصنيف "مواتٍ" مع كونها ضارة فعلياً.
الخطر: المحامي يعتمد على النظام للمراجعة، فيفوته البند الضار الذي يبدو للنموذج "آمناً".
← قسم: ML Attack Staging — AML.T004315كيف تكتشف Backdoor في نموذج NLP تمّ الاستحواذ عليه من مستودع HuggingFace؟
استراتيجية الكشف تعمل على مستويين:
مستوى السلوك: بنِ test suite يحتوي على نصوص طبيعية + نفس النصوص مع إضافة كلمات مشبوهة بشكل منهجي. إذا لاحظت انحرافاً غير مبرر في التصنيف عند وجود كلمة بعينها — مرشح جاد للـ Trigger.
مستوى الأوزان: استخدم أدوات تحليل النموذج (مثل TensorTrust أو Fairness Indicators) لتحديد Neurons شاذة الاستجابة — نشاط غير طبيعي في Activation map يُشير إلى Backdoor.
الوقاية: تحقق دائماً من hash الملف مقارنةً بالمصدر الأصلي + راجع commit history.
← قسم: AML.T001816كيف تربط نتائج Red Teaming الخاصة بهجوم Tay (دراسة الحالة) بتكتيكات ATLAS وتوصيات NIST؟
تكتيك ATLAS: AML.T0020 (Poison Training Data عبر Online Learning) + AML.T0047 (ML Service Abuse).
الإخفاق في NIST AI RMF:
- GOVERN.6: غياب سياسات الاستخدام الآمن لنماذج التعلّم الحي.
- MAP.5: لم تُحدَّد ظروف الفشل المحتمل (بما فيها التلاعب الجماعي).
- MANAGE.2: لم تُوجَد آليات إيقاف/استجابة بما فيها تعليق النظام في حال سلوك شاذ.
التوصية: أي نموذج يتعلم من تفاعلات حية يحتاج HITL (Human-In-The-Loop) للمراجعة الدورية + حد أدنى من عينات التدريب المراجعة يدوياً.
← دراسة الحالة + مقارنة الأطر17كيف يستخدم مُختبِر لغوي عربي تكتيك AML.T0000 (Reconnaissance) لتقييم نظام ترجمة AI عربي؟
يبدأ بالبحث العلني (AML.T0000):
1) تحقق من أي أوراق بحثية للمطوِّر تُشير إلى بيانات التدريب — هل تضمنت نصوصاً عربية قانونية محددة (كمواقع وزارات، مستودعات عقود)؟
2) ابحث في GitHub/LinkedIn لمعرفة الفريق الهندسي والتقنيات المستخدمة (هل يذكرون مكتبات بعينها؟).
3) جرِّب مصطلحات قانونية نادرة أو عاميّات قانونية إقليمية — تفاوت الجودة يكشف حدود corpus التدريب جغرافياً.
المُختبِر اللغوي يمتلك ميزة على المُختبِر التقني هنا: يعرف حدود اللغة العربية وتنوّعاتها، مما يجعله قادراً على Probing لا يخطر لمهندس البرمجيات.
← قسم: Reconnaissance18كيف تصنِّف هجوم Prompt Injection في ATLAS؟ وكيف يختلف تعامل OWASP وATLAS معه؟
في ATLAS، Prompt Injection يُصنَّف تحت AML.T0043 (Craft Adversarial Data) كتقنية فرعية — التركيز على كيفية صياغة البيانات العدائية والهدف منها (تجاوز الحماية، خداع الاستدلال).
في OWASP، هو LLM01 — التركيز على الثغرة من منظور التطبيق وكيفية سدّها (Input validation, System Prompt design).
الفرق الجوهري: ATLAS يُخبرك بالتكتيك والنية (يريد المهاجم تغيير سلوك النموذج). OWASP يُخبرك بالثغرة والعلاج (التطبيق لا يُنظِّف المدخل). الاثنان معاً يُعطيانك صورة كاملة.
← قسم: ML Attack Staging + مقارنة الأطر19كيف تتكامل مراحل ATLAS Kill Chain مع وظائف NIST AI RMF الأربع؟
GOVERN: يُغطّي ما قبل Kill Chain — وضع السياسات التي تحدّ من سطح الهجوم (قيود على بيانات التدريب، سياسات الـ API).
MAP: يتوافق مع مرحلة Resource Development وجزء من Reconnaissance — فهم سياق النظام وتحديد أين يمكن أن تقع الثغرات.
MEASURE: يوازي المختبِر الذي يُنفِّذ ML Attack Staging — قياس مدى صمود النموذج أمام التقنيات الموثَّقة في ATLAS.
MANAGE: يتوافق مع الاستجابة لمراحل Exfiltration وImpact — كيف تُحيِّد الأثر وتُصحِّح النظام؟
← قسم: مقارنة الأطر20لماذا يُعدّ MITRE ATLAS أشمل من OWASP LLM Top 10 لتهديدات ML — وفي أي سياق يكون OWASP أكثر فائدة؟
ATLAS أشمل لأن: يغطي كامل سلسلة الهجوم من الاستطلاع حتى التأثير، يشمل أنواع نماذج متعددة (ليس LLMs فقط — بل Vision Models، Tabular Models، RL Systems)، ويُوفِّر دراسات حالة حقيقية تُغني التحليل التاريخي.
OWASP أكثر فائدة حين: تُريد قائمة مراجعة سريعة لتطبيق LLM محدد، تُريد أتمتة الاختبار (promptfoo يدعمه مباشرةً)، تُريد توصيل الثغرات لمطوِّرين بلغة مألوفة لهم من بيئة OWASP الويب.
الخلاصة العملية: استخدم ATLAS لـ Threat Modeling وتصميم Playbooks، استخدم OWASP كـ checklist تشغيلي في مرحلة الاختبار.
← قسم: مقارنة الأطر