تقييم مُسبق وخالٍ من التسرب لنماذج LLM أثناء مونديال 2026
ورقة قيمت ستة frontier LLMs خلال 39 يوماً من كأس العالم 2026 بشكل مُسبق وخالٍ من التسرب، وجمعت 4,494 تنبؤاً مسجلاً وأصدرت البيانات والرمز.
ورقة قيمت ستة frontier LLMs خلال 39 يوماً من كأس العالم 2026 بشكل مُسبق وخالٍ من التسرب، وجمعت 4,494 تنبؤاً مسجلاً وأصدرت البيانات والرمز.
ورقة تقترح Logic-PPT: تهيئة أولية لنماذج اللغة على بيانات استدلال رسمية. على مقياس 100B توكين، تؤدي إلى اكتساب أسرع للمهارات اللغوية (80% دقة مع تقليل ~36B توكين) وتغيّر هندسة التمثيلات داخلياً بما يُسهِم في ضغط أفضل (مطابقة النموذج الكثيف عند ≈33% تشذيب). النتائج من الورقة على arXiv.
EvoLib يحول تجارب الاستدلال إلى مكتبة معرفية متطورة تُصلح وتُوزن دون تحديث النموذج، وتعمل مع نماذج سوداء بحسب Microsoft Research.
Anthropic يجعل Claude Opus 5 الافتراضي (1M سياق)، يحدث fast mode والأسعار، ويضيف تحسينات تشغيلية وسيناريوهات sandbox في Claude Code v2.1.219.