شركة Zhipu تطلق نموذج GLM-5.3-FlashX بسرعة استدلال تصل إلى 200 توكن/ثانية

أطلقت Zhiyu رسمياً النموذج الكبير GLM-5.3-FlashX في 18 سبتمبر، حيث يمكن أن تصل سرعة الاستدلال القصوى إلى 200 tokens/s، ويهدف هذا النموذج إلى توفير تجربة نموذج أسرع وأكثر سلاسة للشركات والمطورين. حالياً، تم إطلاق واجهة برمجة التطبيقات (API) الخاصة بـ GLM-5.3-FlashX. وفقاً للتعريف، ولتلبية الطلب المتزايد بسرعة من المستخدمين، زادت Zhiyu من استثماراتها في البنية التحتية وتحسين الاستدلال على أساس قوة المعالجة الخاصة بالرقائق المحلية. لا يزال GLM-5.3-Flash يحتفظ بأعلى مستوى ذكاء في نفس الحجم، ويتميز بتكلفة فعالة للغاية، حيث عززت هذه الزيادة في السرعة من تنافسيته الشاملة في الذكاء والسعر والسرعة.

وفقاً للمعلومات، قامت Zhiyu بإجراء اختبار واسع النطاق للنموذج GLM-5.3-Flash قبل الإطلاق الرسمي تحت اسم النموذج المجهول “Ox Alpha” للمطورين في جميع أنحاء العالم، وقد حصل على اعتراف واسع. بعد الإطلاق، استمر حجم الاستدعاءات في الارتفاع، حيث تصدر قائمة الاستخدامات على منصة OpenRouter، وسجل أيضاً أرقاماً قياسية جديدة في حجم الاستدعاءات على منصتي OpenCode وOpenRouter. وأشارت Zhiyu إلى أنه تم استثمار 100,000 رقاقة محلية لمعالجة جميع طلبات الاستدعاء عبر الإنترنت لـ GLM-5.3-Flash.

على الرغم من عدم الكشف عن الشركات المصنعة المحددة للرقائق، إلا أن بعض المحللين في الصناعة يعتقدون أنها قد تستخدم على الأرجح رقائق سلسلة Ascend من Huawei.

يمتاز Zhiyu GLM-5.3-FlashX بقدرة استدلال فعالة

على مستوى التجميع، اعتمدت Zhiyu هيكل EPD المنفصل من الدرجة الإنتاجية، حيث تم تقسيم الترميز متعدد الأنماط، وتعبئة الطلبات مسبقاً، وفك التشفير لكل توكن إلى مجموعات عمل مستقلة وقابلة للتوسع، مما أدى إلى تحسين أداء الخدمة من النهاية إلى النهاية بمعدل ثلاثة أضعاف مقارنة بالخط الأساسي الأولي، وقد وصلت كفاءة الأجهزة وتكلفة كل توكن إلى مستوى يعادل وحدات معالجة الرسوميات (GPU) من إنفيديا السائدة. وأكدت Zhiyu أن هذه التحسينات أثبتت قدرة الرقائق المحلية على دعم احتياجات الاستدلال للنماذج المتقدمة بكفاءة واقتصادية في السيناريوهات واسعة النطاق.

محتوى أصلي
هذا المقال هو النسخة العربية لمحتوى أصلي من TechRitual.
Stein Yep
Stein Yep