المُبحّثون في مايكروسوفت يصرحون بأن نماذج الذكاء الاصطناعي لا تزال غير قادرة على حل المشكلات المعقدة.

المُبحّثون في مايكروسوفت يصرحون بأن نماذج الذكاء الاصطناعي لا تزال غير قادرة على حل المشكلات المعقدة.

19 hardware

باحثون من مايكروسوفت كشفوا حدود نماذج اللغة الضخمة الحديثة (LLM) عند تنفيذ مهام معقدة ومتعددة

في إطار تجارب Microsoft Research، تبين أن حتى أكثر النماذج الذكاء الاصطناعي تقدماً ترتكب أخطاء جسيمة عندما يُطلب منها إجراء عمليات طويلة ومتدرجة. بين الأنظمة التي تم اختبارها — Gemini 3.1 Pro، Claude 4.6 Opus و GPT 5.4 — فقدت كل واحدة في المتوسط حوالي 25٪ من محتوى المستندات بعد المعالجة الذاتية.

ما اختبروه بالضبط
* معيار DELEGATE‑52

تم إنشاؤه بواسطة فريق فليب لابان، توبياس شنبيل وجينيفر نيفيل. يحاكي سير العمل في 52 مجالاً مهنيًا: من البرمجة وتدوين النوتات إلى الكريستالوجيا.

* معيار التقييم

تم تقييم النماذج بناءً على مدى الحفاظ على سلامة المستند بعد 20 دورة معالجة. تم تحديد عتبة "الاستعداد" عند 98٪ — إذا انخفض الناتج تحت ذلك، اعتُبرت المهمة غير ناجحة.

النتائج الرئيسية
المجال أفضل النتائج برمجة أقوى مؤشرات لغة طبيعية أقل موثوقية
* انخفاض الجودة

في أكثر من 80٪ من تركيبات المستندات، انخفضت الجودة إلى 80٪ أو أقل. النموذج الأفضل (Gemini 3.1 Pro) استوفى معايير الاستعداد فقط في 11 من أصل 52 مجالًا.

* أخطاء متقطعة

لم تحدث الخسائر تدريجيًا، بل "بقفزات": خلال دورة واحدة قد تفقد النموذج بين 10٪ و30٪ من الدقة. النماذج الأكثر تقدماً (Gemini 3.1 Pro، Claude 4.6، GPT 5.4) حاولت تجنب الأخطاء الصغيرة، متأخِّرة معالجتها إلى مراحل لاحقة وتقليل عدد التفاعلات.

* إدارة الوكيل

عند استخدام الأدوات في وضع إدارة الوكيل لم تتحسن النتائج: بنهاية الدورة انخفضت الجودة بحوالي 6٪.

ماذا يعني ذلك للمستخدمين
يشدد العلماء على أن المستخدمين لا يزالون بحاجة إلى مراقبة دقيقة لعمل نظم الذكاء الاصطناعي عند تفويضها للمهام. النماذج الحالية قادرة على العمل بشكل مستقل فقط في مجالات ضيقة.

مع ذلك، يشير مؤلفو معيار DELEGATE‑52 إلى تقدم ملحوظ: تحسنت مجموعة نماذج OpenAI خلال 16 شهرًا من أداء 14.7٪ إلى 71.5٪. يثبت هذا أن LLM لا تزال تتطور، لكنها ما زالت محدودة في المهام المعقدة المتعددة.

التعليقات (0)

شارك أفكارك — يرجى الالتزام بالأدب والبقاء ضمن الموضوع.

لا توجد تعليقات بعد. اترك تعليقًا وشارك رأيك!

لترك تعليق، يرجى تسجيل الدخول.

سجّل الدخول للتعليق