الأخبار
مركز أخبار الذكاء الاصطناعي: ابحث، صفِّ، وتابع الأهم فالأحدث.
آخر الأخبار
الأربعاء، ٥ أغسطس
الثلاثاء، ٤ أغسطس
ParVL: إطار موازٍ لتوسيع حسابات النماذج متعددة الوسائط
ParVL إطار يوسع الحساب الموازي في MLLMs عبر تكرار استخدام ViT وLLM مع بادئات فرعية؛ أظهر تحسناً مقابل أسلوب فرعٍ واحد، والتخصيص الأمثل يختلف حسب المهمة.
المصدر: arXiv Computation and LanguageSocietyBench: معيار جديد لتقييم قدرة النماذج على توقع تطورات العالم الاجتماعي في إطار «عوالم مضادة للواقع»
SocietyBench إطار تقييمي يحول تغطية الأخبار ووسائل التواصل إلى جداول زمنية مؤرخة ثم يُجهّلها عبر استبدال الكيانات وتحريك التواريخ لإنتاج «عوالم مضادة». ينتج عن ذلك بنوك أسئلة تنبؤية تُقَيَّم على معايرة الاحتمال والدقة الزمنية؛ أفضل من بين ستة LLMs حقق 75/100 مقابل مرجع بسيط 50. جميع البيانات والشفرات منشورة على arXiv.
المصدر: arXiv Computation and Languageتقييم مُسبق وخالٍ من التسرب لنماذج LLM أثناء مونديال 2026
ورقة قيمت ستة frontier LLMs خلال 39 يوماً من كأس العالم 2026 بشكل مُسبق وخالٍ من التسرب، وجمعت 4,494 تنبؤاً مسجلاً وأصدرت البيانات والرمز.
المصدر: arXiv Computation and LanguageTurnSight: إشراف بأثر رجعي على مستوى الدور لـ TIR
TurnSight يقترح إشرافًا بأثر رجعي على مستوى الدور لتحسين تدريب وكلاء LLM عند استخدام أدوات. الكود متاح على GitHub. الاختبارات أفادت بتحسّن على ثلاث مجموعات معيارية.
المصدر: arXiv Artificial IntelligencePAST-Bench: قياس تحسّن الوكلاء الشخصيين عبر الخبرة المحتفظ بها
PAST-Bench يقيس ما إذا كانت الخبرة المحتفظ بها تُحسن أداء الوكلاء الشخصيين. التجربة تُشغّل مهام متسلسلة مع إيقاف/تشغيل الذاكرة وHermes+ يحسّن النتائج بحسب الورقة ومستودع الكود.
المصدر: arXiv Computation and Languageبحث جديد يوضّح «توسيع الاختبار» في نماذج اللغة: تعريف منهجي، مقاييس قابلة للتكرار وإطلاق أثرية ضخمة
ورقة بحثية (arXiv) تؤطّر "test-time scaling" كاستدلال بميزانية على شجرة البادئات الضمنية لنماذج autoregressive، تميّز ثلاث نظم (مسار واحد، أوراق مع تجميع، ومستوى البادئات)، تقترح ملف تقييم ومواصفات قابلة للتكرار، وتعلن عن تجميع أكثر من 2 مليار أثر استدلالي للإصدار.
المصدر: arXiv Artificial Intelligenceتقييم نماذج الانتشار الشرطي لصور الباثولوجيا التركيبية
دراسة تقترح تعديل FID وIS باستخدام foundation models للباثولوجيا وتظهر ارتباطًا أعلى للمقياس المعدل مع آداء تجزئة النوى.
المصدر: arXiv Machine Learningبحث جديد: هل تستعيد نماذج اللغة الكبيرة قواعد تحسين يغفِلها المجمعون؟
ورقة arXiv تُقدّم SeGaBench، معيارًا تجريبيًا يختبر قدرة نماذج اللغة الكبيرة على استعادة «الدلالات المُمكنة» التي يغفلها تمثيل البرنامج لدى المجمع، وإنتاج تحويهات مُتحقّق منها تحسّن الأداء. أقوى نموذج حقق نسبة صحّة 94.8% وسرعات محسّنة في 83.3% من الإجابات، لكن النتائج غالبًا تغلق جزءًا فقط من الفجوة المثالية.
المصدر: arXiv Artificial IntelligenceVideo-DeepResearch: وكيل متعدد الوسائط لفهم الفيديو مع بحث ويب مرحلي—مقتطفات من ورقة على arXiv
ورقة على arXiv تعرض Video-DeepResearch (Video-DR)، إطارًا لوكلاء يتعاملون مع تدفقات الفيديو المتصلة ويجبرون الوكيل على التأريض عبر الإطارات قبل استخدام بحث الويب. تقدم أيضاً مرجعية Video-DR-Bench (200 حالات VQA متعددة القفز) ووصفة تدريب: ضبط خاضع للإشراف يليه Group Relative Policy Optimization (GRPO). المؤلفون يبلغون عن أداء رائد على المعيار المخصص.
المصدر: arXiv Artificial IntelligenceReflectRL: إعادة استخدام المسارات الفاشلة لتحسين استدلال LLMs
ورقة تقترح ReflectRL لاستخدام المسارات الخاطئة للخبراء كفرص تأملية ثم نقل السلوك إلى استدلال مباشر لتحسين أداء النماذج في مسائل صعبة.
المصدر: arXiv Artificial Intelligenceتدريب سياسات GFlowNets عبر هندسة معلوماتية
ورقة تقترح إطاراً معلوماتياً لتدريب سياسات GFlowNets عبر مقياس Fisher‑Rao وتحدد ثلاثٍ مناصٍ حسابية لتقريبه واستخدامه عملياً.
المصدر: arXiv Machine LearningMuon يحسّن الإسقاط في Mamba-2 130M
تجربة على Mamba-2 130M تظهر أن Muon يحسّن كفاءة التوكن عند تطبيقه على إخراج الإسقاط فقط، وليس على مدخل الإسقاط أو كليهما.
المصدر: arXiv Machine Learningما قبل التهيئة بالمنطق: تهيئة نماذج اللغة على استدلالات رسمية تُسرِّع التعلم وتُسهِم في ضغط النماذج
ورقة تقترح Logic-PPT: تهيئة أولية لنماذج اللغة على بيانات استدلال رسمية. على مقياس 100B توكين، تؤدي إلى اكتساب أسرع للمهارات اللغوية (80% دقة مع تقليل ~36B توكين) وتغيّر هندسة التمثيلات داخلياً بما يُسهِم في ضغط أفضل (مطابقة النموذج الكثيف عند ≈33% تشذيب). النتائج من الورقة على arXiv.
المصدر: arXiv Machine Learningالاثنين، ٣ أغسطس
ميتا تضاعف كفاءة تدريب GEM على نطاق LLM
ميتا ضاعفت كفاءة تدريب GEM إلى 20–25% MFU عبر نوى مخصصة، MXFP8، وتوازي شبكي 5D، حسب منشور مهندسي Meta.
المصدر: Meta EngineeringOrchard: إطار مفتوح لتدريب وكلاء الذكاء الاصطناعي
Microsoft Research أصدرت Orchard، إطار Kubernetes مفتوح لتدريب وتقييم وكلاء ذكيين مع بيئات قابلة لإعادة الاستخدام ووصفات Orchard‑SWE وOrchard‑GUI وOrchard‑Claw.
المصدر: Microsoft Research Blogالخميس، ٣٠ يوليو
Google تطلق Science One Framework للتحقق من أبحاث الوكلاء
Google Research قدمت Science One Framework لربط الادعاءات بأدلة قابلة للتحقق عبر نهج Chain-of-Evidence، مع بروتوتايب واختبارات توضيحية.
المصدر: Google Research BlogEchoverse: عوالم تدريب عميقة لوكلاء استخدام الحاسوب
Echoverse يبني عوالم محاكاة عميقة وقابلة لإعادة الضبط لتدريب وكلاء استخدام الحاسوب ويصدر شيفرة وأدوات لأربعة عوالم مع محككات قاعدة بيانات.
المصدر: Microsoft Research BlogEvoLib: تحويل الخبرة إلى معرفة قابلة للتطور
EvoLib يحول تجارب الاستدلال إلى مكتبة معرفية متطورة تُصلح وتُوزن دون تحديث النموذج، وتعمل مع نماذج سوداء بحسب Microsoft Research.
المصدر: Microsoft Research Blogالأربعاء، ٢٩ يوليو
الاثنين، ٢٧ يوليو
الجمعة، ٢٤ يوليو
الأربعاء، ٢٢ يوليو
Google Research تطور SymptomAI لوكيل محادثة لتقييم الأعراض
Google Research تعلن SymptomAI، مشروع بحثي لوكيل محادثة لتقييم الأعراض مع تركيز على التقييم والسلامة وليس بديلاً عن الرعاية السريرية.
المصدر: Google Research Blogجوجل تبحث استخدام التعلم الآلي لتصحيح أخطاء الحواسيب الكمومية
Google Research عرضت طرقًا بحثية تستخدم التعلم الآلي لرصد ونمذجة وتخفيف أخطاء الأجهزة الكمومية. العمل يظل بحثيًا وليس خدمة إنتاجية.
المصدر: Google Research Blogالأربعاء، ١٥ يوليو
جوجل تبحث في «إبداع» نماذج diffusion
Google Research نشر تحليلًا حول سلوك الإبداع في نماذج diffusion ويقدمه كمعالجة بحثية في فئة Algorithms & Theory.
المصدر: Google Research BlogMeta تطور تمثيلاً هرمياً للاهتمامات لإعلانات deep funnel
Meta تصف نظاماً هرميّاً للاهتمامات يربط المستخدمين والكيانات الإعلانية ويصدر تمثيلات وقابضمفردة تستخدم عبر بندقية الإعلانات. لا توجد أرقام أداء منشورة.
المصدر: Meta EngineeringPerplexity تشرح SPACE لتشغيل وكلاء طويلة المدة
تشرح Perplexity Research منصة SPACE التي تشغّل وكلاء طويلة المدة داخل بيئات آمنة وفعالة.
المصدر: Perplexity Research