أطلقت منصة Qwen AI التابعة لشركة علي بابا نموذج Qwen3-Max-Flash رسميًا في 27 أغسطس، والذي يتميز بهيكله المتنوع من نوع الخبراء المختلطين (MoE) ويستهدف تقديم أفضل قيمة مقابل السعر. السعر الرسمي المعلن هو: رسوم إدخال لكل مليون توكن RMB¥0.80 (حوالي HK$0)، رسوم إخراج لكل مليون توكن RMB¥2.70 (حوالي HK$2)، رسوم وصول سريع لكل مليون توكن RMB¥0.10 (حوالي HK$0).
نموذج Qwen3-Max-Flash يعتمد على هيكل انتباه مختلط جديد
يعتمد Qwen3-Max-Flash على هيكل الجيل التالي (Next) الذي يختلف تمامًا عن النماذج الكبيرة السابقة، حيث يصل إجمالي عدد المعلمات إلى مئات المليارات، ولكن يتم تفعيل 6 مليارات (6B) معلمة فقط في كل استنتاج، مما يدعي أنه يحقق معايير كفاءة جديدة على مستوى العالم. في آلية الانتباه، يقدم النموذج آلية الانتباه النادرة QSA (Qwen Sparse Attention) الفريدة، والتي تتكامل بكفاءة مع GDN لتشكيل هيكل انتباه مختلط، مما يزيد من سرعة الحساب في سيناريوهات السياق الطويلة التي تصل إلى 1M توكن، بأكثر من 8 مرات مقارنة بالحلول التقليدية، مع الحفاظ على الدقة.
فيما يتعلق بالاتصالات الداخلية الهرمية، يستخدم النموذج طريقة Gated Residual المطورة ذاتيًا، حيث يقوم بتقسيم قناة المعلومات الرئيسية التقليدية في Transformer إلى 4 قنوات مستقلة، مما يسمح للنموذج بتحديد مسارات القراءة والكتابة ديناميكيًا حسب الحاجة، مما يجعل نقل المعلومات أكثر كفاءة ويزيد من استقرار التدريب. هذا التصميم يغير عنق الزجاجة الناتج عن القناة الواحدة السابقة، مما يسهل تدفق التدرجات أثناء التدريب على نطاق واسع.
51B N-gram Embedding يعزز كفاءة توسيع المعلمات
فيما يتعلق بتوسيع المعلمات، يقدم النموذج معلمات N-gram Embedding إضافية بحجم 51B، مما يوفر وظيفة تحديد موقع فعالة لهيكل Transformer. لا تحتاج هذه المعلمات إلى تفعيل فوري في كل عملية حساب توكن، بل تستخدم موارد منخفضة جدًا “لتوصيل” دليل ذاكرة كبير، مما يعزز بشكل كبير كفاءة توسيع معلمات النموذج ويقلل من تكاليف التدريب. من خلال هذا التصميم المفصول، يتمكن النموذج من تحميل المزيد من المعرفة العالمية مسبقًا إلى المعلمات الثابتة مع الحفاظ على سرعة الاستنتاج.
فيما يتعلق بضبط المعلمات، يتبنى Qwen3-Max-Flash استراتيجية تقدم متزامن بين هيكل النموذج والتحسينات اللاحقة، مما يؤدي إلى تحسين كبير في كفاءة التقارب وإنتاجية التدريب. بناءً على التقنيات المذكورة أعلاه، يمكن للنموذج الجديد تقديم خدمات استنتاج فعالة بتكلفة أقل في سيناريوهات المهام الحقيقية مثل البرمجة وAgent، مما يوفر خيارات أكثر فعالية من حيث التكلفة للتطبيقات على مستوى المؤسسات.
| البند | المواصفات |
|---|---|
| نوع الهيكل | خبراء مختلطون متعددون (MoE) |
| إجمالي عدد المعلمات | مئات المليارات |
| المعلمات النشطة | 6 مليارات (6B) |
| معلمات N-gram Embedding | 51B |
| آلية الانتباه | QSA انتباه نادر + هيكل مختلط GDN |
| زيادة سرعة السياق الطويل | زيادة بأكثر من 8 مرات في سيناريوهات 1M توكن ذات الوصول السريع |
| سعر الإدخال | RMB¥0.80 (حوالي HK$0) |
| سعر الإخراج | RMB¥2.70 (حوالي HK$2) |
| سعر الوصول السريع | RMB¥0.10 (حوالي HK$0) |

