في أبريل 2026، بنى باحثون في جامعة بيركلي وكيل ذكاء اصطناعي سجّل 100% في سبعة من ثمانية معايير قياسية رائدة لتقييم الوكلاء، من بينها SWE-bench Verified وPro، وTerminal-Bench، وWebArena، وFieldWorkArena، وCAR-bench. لم يحل الوكيل أي مهمة فعلية من هذه المهام. بدلًا من ذلك، قرأ كود التصحيح واستغل ثغراته: ملف اختبار من عشرة أسطر أعاد كتابة كل نتيجة على أنها "ناجحة"، وأمر curl مستبدَل كان يُعيد دائمًا الإجابة المتوقعة، وملف إعدادات سرّب مفتاح الإجابات مباشرة. من أصل 13 معيارًا اختبره الفريق، صُنِّف كل واحد منها على أنه قابل للاستغلال.
هذه النتيجة ليست قصة عن فريق بحثي واحد بارع. إنها تحذير بشأن ما تخبرك به فعليًا الدرجة المرتفعة في لوحة صدارة عامة قبل أن تضع وكيلًا أمام عملاء حقيقيين، أو فواتير حقيقية، أو بنية تحتية حقيقية: لا شيء يُذكر، ما لم تكن أنت من بنى الاختبار بنفسك.
لماذا اختبارات الوكلاء ليست اختبارات نماذج
معظم الفرق التي تُقيّم الذكاء الاصطناعي اليوم ما زالت تحمل عادات موروثة من تقييم النماذج: أدخل سؤالًا، قيّم المخرَج، وقارن الدرجة بلوحة الصدارة. هذا النهج ينهار أمام الوكيل، لأن ما تقيّمه ليس مجرد استجابة، بل مسار كامل: التعليمات الأساسية، طلب المستخدم، كل استدعاء أداة قام به الوكيل بمعطياته وقيمه المُعادة، أي استرجاع بيانات نفّذه، التفكير الوسيط، والنتيجة النهائية. قد تبدو إجابة صحيحة وهي ناتجة عن أداة خاطئة استُدعيت بمعطيات خاطئة ثم جاء تخمين موفّق. وقد تبدو إجابة خاطئة وهي ناتجة عن مسار سليم انحرف بسبب استجابة واحدة سيئة من واجهة برمجية. الاكتفاء بتقييم الإجابة النهائية يُخفي أيًا من هذين السيناريوهين وقع فعلًا، وهذه بالضبط هي الثغرة التي استغلها تلاعب المعايير.
الفرق المؤسسية التي تبني خطوط تقييم خاصة بها في 2026 تتجه نحو ستة أبعاد تُقيَّم كل منها بشكل مستقل بدلًا من دمجها في رقم نجاح أو رسوب واحد، وفق نمط عمل مستمد من عمليات نشر وكلاء فعلية في الإنتاج:
| البُعد | ما يقيسه | الخلل الشائع عند إغفاله |
|---|---|---|
| اختيار الأداة | اختيار الأداة الصحيحة، أو عدم استخدام أداة عن حق | استدعاء أداة ملفّقة، أو أداة خاطئة للمهمة |
| استخراج المعطيات | معطيات صحيحة البنية والمعنى | أداة صحيحة بتاريخ مشوّه أو حقل ناقص |
| الاستفادة من النتيجة | استخدام الوكيل فعليًا لمخرَج الأداة | تجاهل البيانات واستبدالها بتخمين النموذج |
| التعافي من الأخطاء | إعادة المحاولة أو التحويل أو التصعيد عند الفشل | تعطّل، نجاح وهمي، إعادة محاولة عمياء |
| تماسك الخطة | بلا حلقات تكرار ولا طرق مسدودة وبعمق مناسب | حلقة لا نهائية، إنهاء مبكر للخطة |
| إتمام المهمة | تحقق الهدف الكامل من البداية للنهاية | كل خطوة ناجحة على حدة، لكن النتيجة النهائية خاطئة |
اختبار أقل من أربعة من هذه الأبعاد يجعل النتيجة أقرب إلى احتمال إحصائي منها إلى حكم فعلي على جاهزية الوكيل للإطلاق.
لماذا لا تكفي المعايير العامة وحدها
معايير عامة مثل AgentBench وWebArena وSWE-bench وMedAgentBench وtau-bench مفيدة لمقارنة القدرة الخام بين النماذج، وتمثّل أرضية مرجعية مفيدة. لكن لم تُصمَّم أي منها لاختبار مخططات بياناتك، أو أدواتك الداخلية، أو قواعد الامتثال الخاصة بك، وبحلول 2026 أصبح واسع الانتشار التقرير بأنها تشبّعت وأصبحت قابلة للتلاعب، قبل أن تجعل ثغرة بيركلي هذه الحقيقة مستحيلة التجاهل. الدرجة المرتفعة في لوحة الصدارة مؤشر على أداء النموذج في بيئة مختبرية. إنها ليست دليلًا على أن الوكيل نفسه، بعد ربطه بنظام إدارة علاقات العملاء لديك وسير عمل الموافقات الخاص بك، سيتصرف بالطريقة نفسها في الساعة الـ400 من حركة الإنتاج الفعلية.
الأثر العملي هو أن المعايير العامة مكانها في بداية برنامج التقييم، لا في نهايته. فهي تخبرك ما إذا كان النموذج المرشح يتجاوز حدًا أدنى معقولًا قبل أن تستثمر في بناء أي شيء فوقه.
بناء التقييم الذي يحدد فعليًا قرار الإطلاق
النمط العملي، المتسق مع كيفية بناء الفرق المؤسسية لهذا الأمر في 2026، يتكون من ثلاث طبقات:
1. مجموعة تقييم خاصة ومحجوبة مبنية من سير عملك الحقيقي. اكتب سيناريوهات تستخدم أدواتك الفعلية، وأشكال بياناتك، والحالات الحدّية التي يعرف فريقك بالفعل أنها تكسر الأمور: العميل الذي لديه تذكرتان مفتوحتان، الفاتورة ذات عدم تطابق العملة، الطلب الذي يجب رفضه. هذه هي المجموعة التي لم يرها النموذج من قبل، وهذا بالضبط هو المغزى منها. يمكن دراسة معيار عام مسبقًا؛ أما المعيار الخاص، إن حُفظ داخليًا، فلا يمكن ذلك.
2. تقييم لكل بُعد على حدة مدمج في خط التكامل المستمر، لا معدل نجاح واحد. اربط إطلاق النسخ بعتبات لكل بُعد (اختيار الأداة، استخراج المعطيات، وبقية الأبعاد)، بحيث لا يستطيع تراجع في بُعد التعافي من الأخطاء أن يختبئ خلف رقم إتمام مهام إجمالي قوي. الفرق التي تنفّذ هذا بشكل جيد تعامل أي انخفاض في بُعد واحد باعتباره سببًا لحجب الإصدار، تمامًا كما يحجب فريق الأمن بناء النسخة بسبب فشل اختبار واحد بدلًا من معادلته بالاختبارات الناجحة.
3. حلقة تغذية راجعة من الإنتاج إلى مجموعة التقييم. كل فشل حقيقي يواجهه الوكيل في الإنتاج هو اختبار انحدار مجاني إذا التقط أحدهم المسار وأضافه إلى المجموعة الخاصة. تخطّي هذه الخطوة يعني دفع ثمن نمط الفشل نفسه مرتين: مرة عندما يصطدم به عميل، ومرة أخرى بعد أشهر حين تُعيد نسخة جديدة من الوكيل إدخاله.
ما يعنيه هذا قبل إطلاق وكيلك القادم
لا شيء من هذا يتطلب مختبرًا بحثيًا. إنه يتطلب أن تقرر، قبل أن يُطلَق الوكيل، أي دليل على مستوى المسار سيجعل فريقك مرتاحًا لإطلاقه، ورفض السماح لرقم لوحة صدارة عامة بأن يحل محل ذاك القرار. إذا كانت مؤسستك تُشغّل برامج تجريبية لوكلاء الذكاء الاصطناعي، والدليل الوحيد وراء قرار الإطلاق هو عرض توضيحي ودرجة معيار، فتلك هي الثغرة التي كشفتها نتيجة بيركلي، وهي أقرب إلى القاعدة منها إلى الاستثناء.
هذا أيضًا هو المكان الذي يتصل فيه التقييم بمشكلة القياس التي تناولناها في مقال قياس العائد على الاستثمار في الذكاء الاصطناعي الوكيلي: الرقم الأساسي الذي لا يمكن الوثوق به على مستوى المسار لا يمكنه دعم قرار التوسع أيضًا، مهما بدت لوحة المؤشرات الرئيسية نظيفة من الأعلى. المجالان، تقييم الوكلاء وقياس العائد على الاستثمار، يجب أن يُبنيا معًا، لا أن يُضاف أحدهما لاحقًا كترقيع.
إذا كنت تُخطِّط لإطلاق ذكاء اصطناعي وكيلي وتريد تصميم طبقة التقييم جنبًا إلى جنب مع سير العمل بدلًا من إضافتها بعد تعثّر برنامج تجريبي، فإن منهجنا يبدأ من هناك، وقد بنى فريق خدماتنا مجموعات تقييم خاصة لعمليات لم تكن قادرة على تحمّل تراجع صامت. لمعرفة كيف يسير الأمر بعد أن يصبح الوكيل مباشرًا بالفعل، راجع مقالنا عن مراقبة وكلاء الذكاء الاصطناعي. تواصل معنا قبل أن يصبح موعد إطلاق وكيلك القادم هو الدليل الوحيد على جاهزيته.



