Transformers v5.14: وصول Inkling (975B، أوزان مفتوحة) وتحسينات أداء وبنية مهمة للمطوّرين
في إصدار v5.14 من مكتبة Transformers أُضيف نموذج Inkling—نموذج عام متعدد الوسائط بقدرة 975 مليار معلمات إجمالية و41 مليار "نشطة"، وتم نشر الأوزان بصيغة مفتوحة لتسهيل البحث والتكييف. أصدر الفريق أيضًا TIPSv2 ونسخته DPT. بجانب ذلك، تضمّن الإصدار إصلاحات وتحسينات بنيوية: تحديث SDPA prefill لاستخدام FlashAttention مع StaticCache (مُبلَّغ عن تسريع يصل إلى 260% للحالات الكبيرة)، إصلاحات أداء Flash Attention وMoE، تبسيط إدارة الكاش، وعدد من إصلاحات الكيرنل والاختبارات. نُبهت الملاحظات إلى تغييرات توافقية تتطلب تحديثات في الكود (مثلاً remap لطبقات GPTNeoX ودعم attention backend في GPTBigCode لملاءمة vLLM). المصدر: صفحة الإصدارات الرسمية على GitHub.
ماذا حدث؟
أصدرت مكتبة Transformers (v5.14.0) مجموعة تغييرات شاملة تضم إضافة نموذج جديد كبير متعدد الوسائط، إصلاحات أداء وبُنية، وتحسينات تشغيلية للمطوّرين. التفاصيل الرئيسية وفقًا لملاحظات الإصدار على GitHub:
إضافة نموذج Inkling
- تمت إضافة Inkling (وُصفت في الملاحظة بأنها "fresh from Thinking Machines"): نموذج متعدد الوسائط يقبل مدخلات نصية وصورية وصوتية ويُنتج نصًا. الحجم المعلن: 975B معلمات إجمالية و41B "نشط". الإصدار نُشر مع أوزان مفتوحة لدعم البحث والتكييف ودمجه في منتجات الطرف الثالث.
- الاستخدام المقترح: بنى عامة للتحدث والتعليمات، تطبيقات وكيلة agentic، مساعدي برمجة، روبوتات محادثة، وأنظمة استرجاع معزز بالتوليد.
ملاحظة مهمة: إعلان الأوزان المفتوحة يتيح للباحثين والشركات تكييف النموذج للغات وأسواق محلية، لكن تفاصيل الترخيص والاستخدام التجاري يجب مراجعتها في بطاقة النموذج (model card) ونص الترخيص المرتبط بالمستودع قبل الاعتماد التجاري.
إضافات TIPSv2
- أُضيفت نسختا TIPSv2 وTIPSv2 DPT (روابط التوثيق متاحة في ملاحظات الإصدار).
تغييرات توافقية هامة (Breaking changes)
- GPTNeoX يعيد تسمية
embed_outإلىlm_head(remap). - GPTBigCode يعين
_supports_attention_backend = Trueلملاءمة vLLM.
إذا اعتمدت أنظمةكم على أسماء الأوزان القديمة أو على سلوك backend لمكون الانتباه، فستحتاجون إلى تحديث الكود أو سكربتات التحميل لتجنّب الأخطاء.
تحسينات الأداء والبنية
- SDPA prefill تمّ تحديثه لاستخدام FlashAttention kernel مع StaticCache — الملاحظة تشير إلى تسريع يصل إلى 260% للحجم الكبير من الإدخالات (قيمة مُبلَّغ عنها في ملاحظات الإصدار؛ انظر القياسات الخاصة ببيئتكم للتحقق).
- إصلاح تراجعات أداء في Flash Attention، وتصحيح تحسينات فك تشفير MoE للخبراء الموجودين داخل نماذج فرعية.
- تحسين مرونة DeepGEMM Triton fallback عندما تكون متغيرات بيئة CUDA غير مضبوطة بشكل سليم.
تغييرات في الكاش والذاكرة
- تبسيط منطق توجيه الكاش عبر تعيينات صريحة لأنواع الطبقات (sliding/static).
- إصلاح فشل الكاش في بيئات CI للقراءة فقط، ومعالجة نمو مكدس رسومات MPS على Apple Silicon أثناء التدريب على دفعات متغيرة الطول.
تحسينات التوليد والموثوقية
- إضافة دعم Multi-Token Prediction (MTP) في توليد النص.
- إدخال تحقق ensemble ثابت لرفع معدل قبول مسودات speculative decoding.
- إصلاح حالات تعطل في توليد مدعوم بطريق الجشع عند استخدام توكنيزرات مختلفة.
ثروة من إصلاحات الأخطاء ومساهمات المجتمعات
- مئات التعديلات تشمل إصلاحات CI، تحسينات الوثائق، تحديثات لبيئات AMD/Neuronal، تصحيحات لبناء Docker لخاصية flash-attn، ودعم تكوينات متغايرة per-layer.
- قائمة طويلة من المساهمين البارزين ذُكرت في ملاحظة الإصدار.
المصدر: ملاحظات الإصدار الرسمية — Transformers v5.14.0 (GitHub)
https://github.com/huggingface/transformers/releases/tag/v5.14.0