تشير CNMO إلى أن شركة Zhipu AI قد أعلنت رسميًا عن النموذج الأساسي GLM-5.3 في 14 أغسطس. على الرغم من أن الجوهر لا يزال يعتمد على بنية GLM-5.2، إلا أن الأداء العام في البرمجة وقدرات الوكلاء قد تحسن بشكل ملحوظ من خلال تدريب طويل الأمد ومهام طويلة المدى. كما أظهرت قوة أكبر في مجال الهجوم والدفاع السيبراني. يكمن جوهر هذا التحديث في تحسين طرق التدريب وزيادة كفاءة التكاليف، وليس مجرد السعي وراء زيادة حجم المعلمات. وهذا يتماشى مع المنافسين في نماذج الطليعة من نفس النوع، مما يبرز مسارًا آخر لتطوير النماذج الكبيرة في المرحلة الحالية: الفوز بـ “ذكاء تكلفة الوحدة” بكفاءة عالية وتكاليف منخفضة.
تشير CNMO إلى أن تحسين GLM-5.3 لا يعتمد على توسيع حجم النموذج الأساسي، بل يستفيد من تحسينات مرحلة ما بعد التدريب والتدريب العملي في سيناريوهات متعددة المهام، مما يجعل نفس الجيل من النماذج أكثر استقرارًا في مهام متخصصة متعددة. وهذا يتناقض مع الاستراتيجيات السابقة التي اعتبرت حجم المعلمات كمؤشر رئيسي للأداء، مما يظهر أن تحسين القدرات المتقدمة لا يتطلب بالضرورة زيادة متزامنة في استثمارات الحوسبة. من منظور التكلفة، يركز هذا التحديث على كفاءة المعلمات وتكاليف الاستدلال، مما يسمح بتطبيقات البرمجة والوكلاء والشركات التي تحتاج إلى استدعاءات كبيرة على نطاق أوسع بتكاليف أقل.
أفادت CNMO أن أداء GLM-5.3 في عدة اختبارات واقعية يعتبر تقدمًا ملحوظًا؛ حيث ارتفع تقييمه في Terminal-Bench 3.0 من 4.6 إلى 28.3، مما يدل على تحسين قدرات المهام الطويلة والتعاون عبر الأدوات؛ وفي اختبار التركيز DeepSWE v1.1، ارتفع النقاط من 46.2 إلى 66.9، مما يدل على تعزيز قدرات هندسة البرمجيات وتعديل الكود المستمر؛ وفي تقييم Agents’ Last Exam عبر السيناريوهات، ارتفعت النقاط من 23.8 إلى 28.5، مما يعكس نضج التعاون عبر الأدوات. هذه البيانات تثبت مجتمعة أن GLM-5.3 قد حقق تحسينًا ملحوظًا في المهام المتعددة.
كما أشارت CNMO إلى أن GLM-5.3 قد حقق تقييم GDPval-AA v2 يصل إلى 1769 في 44 سيناريو مهني، مما يدل على أن قدراته في البرمجة قد اقتربت من المستوى الاحترافي. أعلنت Zhipu AI أن GLM-5.3 سيتصل اعتبارًا من اليوم بـ ZCode وAutoClaw وGLM Coding Plan، وقد تم إعادة تعيين حصة GLM Coding Plan؛ سيتم إطلاق API في وقت قريب، وسيتم فتح أوزان النموذج الكامل للجمهور في غضون أسبوعين بعد الانتهاء من التقييمات الأمنية اللازمة وتعزيز الأمان. بشكل عام، يركز هذا التحديث على التوازن بين التكلفة والأداء، مما يجعله مناسبًا للسيناريوهات المؤسسية التي تتطلب استدعاءات كبيرة ومهام طويلة المدى.
تظهر تحليلات CNMO أن هذا المسار الذي يركز على تحسين ما بعد التدريب وكفاءة المعلمات العالية قد يغير استراتيجيات النشر التجارية في الفصول القادمة. من خلال المراقبة طويلة الأمد، إذا تمكنت من تحسين استقرار المهام المتعددة والأمان دون زيادة كبيرة في استثمارات الحوسبة، فقد تصبح عائلة GLM-5.3 واحدة من الخيارات الأكثر إقناعًا بين الشركات من حيث التكلفة والأداء. كما يعني ذلك أن النماذج المفتوحة المصدر والنماذج الرائدة المغلقة قد تتنافس في نفس الساحة، مما يدفع نحو تطبيقات وتطورات بيئية أوسع.
القيمة العملية لـ GLM-5.3: كفاءة التكلفة وتوازن جديد للمهام الطويلة
تشير CNMO إلى أن استراتيجية التكلفة لـ GLM-5.3 تركز على كفاءة المعلمات العالية، مما يقلل من تكلفة الاستدلال في كل مرة، وبالتالي يعزز من جدوى النشر على نطاق واسع. بالنسبة للشركات، يعني ذلك أنه حتى في ظل قيود الميزانية والموارد البشرية، يمكن تحقيق التعاون الآلي وتدفقات العمل الآلية عبر عدة أقسام، مما يقلل من التكاليف التشغيلية الإجمالية. هذه الاستراتيجية تمكن المطورين من التركيز أكثر على الابتكار في مستوى التطبيق، بدلاً من أن يتم إعاقة تقدمهم بسبب التوسع في الأجهزة والتدريب على نطاق واسع.
بالإضافة إلى ذلك، أثبت تحسين مرحلة ما بعد التدريب في GLM-5.3 صحة الرأي القائل بأن “حجم النموذج ليس بالضرورة المؤشر الوحيد للأداء”. من خلال تصميم مهام أكثر دقة، وتكامل عبر الأدوات، والتدريب المتكرر على المهام الطويلة، تم تعزيز استقرار النموذج وقابليته للتحكم في المشاريع الطويلة بشكل ملحوظ، وهو أمر مهم بشكل خاص للمهام التي تتطلب تعديلات طويلة الأمد على البرمجيات وتكرارات الخوارزميات. وهذا يعني أيضًا أن النظام البيئي للنماذج المستقبلية قد يشهد ظهور قدرات “إضافية” وإطارات تعاون أكثر ثراءً.
أخيرًا، تلخص CNMO أن إطلاق GLM-5.3 وخططه المستقبلية يوفران مسارًا أكثر استدامة للعملاء من الشركات الذين يحتاجون إلى استدعاءات متكررة واستدلالات طويلة. على الرغم من أن التفاصيل التقنية الأساسية لم تُفتح بالكامل بعد، إلا أن خطة إصدار الأوزان وAPI خلال أسبوعين تشير إلى أن Zhipu AI تدفع بنشاط نحو بناء النظام البيئي والنشر العملي. بالنسبة لمراقبي صناعة التكنولوجيا، يمثل ذلك علامة على أن استراتيجية “تحفيز القدرات المتقدمة من خلال كفاءة التكلفة” تدخل تدريجيًا إلى المستوى العملي، وقد تغير نماذج الأعمال وأنماط التعاون في الفصول القادمة.

