وكلاء

أنظمة تخطّط وتنفّذ مهاماً متعددة الخطوات نيابةً عنك، من البحث إلى الكتابة والتنفيذ.

آخر الأخبار

n8nإطلاق منتج

n8n تصدر تحديث 2.34.2 لتصحيح واجهة المحرر

نشر n8n الإصدار 2.34.2 لإصلاح أخطاء واجهة المحرر وإظهار بيانات اعتماد أدوات الوكيل فوق إعدادات التكوين.

Anthropicإطلاق منتج

LangChain يطلق langchain-anthropic==1.5.4 بإصلاحات صغيرة

LangChain أصدر langchain-anthropic==1.5.4. أصلح مشاكل مخططات الأدوات وحفظ caller.tool_choice وأضاف user_profile_id.

Anthropicإطلاق منتج

Anthropic يطرح Claude Code v2.1.222 بإصلاحات أمان واستقرار

Anthropic أصدر Claude Code v2.1.222 مع إصلاحات أمنية واستقرارية وتعديلات تشغيلية بحسب ملاحظات الإصدار الرسمية.

arXiv Computation and Languageبحث

SocietyBench: معيار جديد لتقييم قدرة النماذج على توقع تطورات العالم الاجتماعي في إطار «عوالم مضادة للواقع»

SocietyBench إطار تقييمي يحول تغطية الأخبار ووسائل التواصل إلى جداول زمنية مؤرخة ثم يُجهّلها عبر استبدال الكيانات وتحريك التواريخ لإنتاج «عوالم مضادة». ينتج عن ذلك بنوك أسئلة تنبؤية تُقَيَّم على معايرة الاحتمال والدقة الزمنية؛ أفضل من بين ستة LLMs حقق 75/100 مقابل مرجع بسيط 50. جميع البيانات والشفرات منشورة على arXiv.

GitHubبحث

TurnSight: إشراف بأثر رجعي على مستوى الدور لـ TIR

TurnSight يقترح إشرافًا بأثر رجعي على مستوى الدور لتحسين تدريب وكلاء LLM عند استخدام أدوات. الكود متاح على GitHub. الاختبارات أفادت بتحسّن على ثلاث مجموعات معيارية.

arXiv Computation and Languageبحث

PAST-Bench: قياس تحسّن الوكلاء الشخصيين عبر الخبرة المحتفظ بها

PAST-Bench يقيس ما إذا كانت الخبرة المحتفظ بها تُحسن أداء الوكلاء الشخصيين. التجربة تُشغّل مهام متسلسلة مع إيقاف/تشغيل الذاكرة وHermes+ يحسّن النتائج بحسب الورقة ومستودع الكود.

أوبن إيه آي / OpenAIبحث

Video-DeepResearch: وكيل متعدد الوسائط لفهم الفيديو مع بحث ويب مرحلي—مقتطفات من ورقة على arXiv

ورقة على arXiv تعرض Video-DeepResearch (Video-DR)، إطارًا لوكلاء يتعاملون مع تدفقات الفيديو المتصلة ويجبرون الوكيل على التأريض عبر الإطارات قبل استخدام بحث الويب. تقدم أيضاً مرجعية Video-DR-Bench (200 حالات VQA متعددة القفز) ووصفة تدريب: ضبط خاضع للإشراف يليه Group Relative Policy Optimization (GRPO). المؤلفون يبلغون عن أداء رائد على المعيار المخصص.

Hugging Faceإصدار نموذج

Hugging Face وLiquidAI تطلقان LFM2.5‑2.6B لتشغيل وكلاء محليين

Hugging Face وLiquidAI أعلنا LFM2.5–2.6B كنماذج بحجم 2.5–2.6 مليار لتشغيل وكلاء محليين، مع تفاصيل محدودة حول الأداء واللغات والترخيص.

أوبن إيه آي / OpenAIإطلاق منتج

n8n 2.34.0: تحسينات استقرار وحوكمة AI

إصدار n8n 2.34.0 يحسّن استقرار تكاملات الذكاء الاصطناعي ويضيف إطار تحقق ل Instance AI ويُعالج نقاط ضعف في اتصالات Bedrock وVertex وOpenAI.

Anthropicإطلاق منتج

Anthropic يطرح Claude Code v2.1.221 مع تحصينات وأدوات تدقيق

Anthropic أصدر Claude Code v2.1.221 مع تحسينات أمان، وضع mask للصناديق الرملية، وأداة prompt-audit، وإصلاحات اعتمادية للمطورين.

GitHubإطلاق منتج

GitHub Copilot يتيح ضبط مستوى التفكير في وكيل السحابة

أضاف GitHub Copilot خيار ضبط مستوى التفكير في وكيل السحابة، وهي ميزة عملية للتحكم بين سرعة التنفيذ وعمق التحليل.

GitHubإطلاق منتج

GitHub Copilot يشغّل الأتمتة من التعليقات

أصبح بإمكان GitHub Copilot تشغيل أتمتة من خلال التعليقات، ما يجعل التفاعل مع الوكيل أقرب إلى سير عمل GitHub اليومي.

النماذج والأدوات

فيديو

فيديو