SpaceXAI تطلق Grok 4.6: الأداء يتوافق مع المعايير ويحتل المرتبة الثالثة عالميًا جنبًا إلى جنب مع GPT-5.6 Sol Max

أصدرت شركة SpaceX AI التابعة لإيلون ماسك مؤخرًا النموذج المتقدم من الجيل الجديد Grok 4.6، والذي يركز بشكل أساسي على الوكلاء الذكيين الذين يعملون لفترات طويلة، والبرمجة، ومشاهد العمل المعرفية، وقد اعتمدت استراتيجية تسعير أكثر تنافسية لتقليل تكاليف تشغيل هذه الأحمال. في مؤشر الذكاء الخاص بشركة Artificial Analysis، حصل Grok 4.6 على درجة 61، متجاوزًا النموذج مفتوح المصدر Kimi K3، ومتساويًا مع OpenAI وGPT-5.6 Sol Max، مما يمثل زيادة قدرها 5 نقاط مقارنة بالجيل السابق Grok 4.5.

حاليًا، يحتل المركزين الأولين كل من Anthropic مع Claude Opus 5 وClaude Fable 5، حيث يتساوى Grok 4.6 وGPT-5.6 Sol Max في المركز الثالث عالميًا.

تعد القدرة على البرمجة والوكلاء الذكيين هي النقطة المحورية في ترقية Grok 4.6. في اختبار DeepSWE v1.1، ارتفعت درجته من 54% إلى 65.9%؛ بينما ارتفعت درجة معيار APEX-Agents من 47.1% إلى 57.5%، بزيادة قدرها 10.4 نقطة مئوية، متجاوزة قليلاً GPT-5.6 Sol Max الذي سجل 56.7%؛ كما ارتفعت درجة Terminal-Bench v3.0 من 15.7% إلى 26%. ومع ذلك، في الاختبارين الأخيرين، لا يزال Claude Fable 5 Max يحتفظ بالصدارة، مما يدل على أن Grok 4.6، على الرغم من تقدمه الملحوظ، لم يحقق بعد السيطرة الكاملة على المنافسين.

Grok 4.6 يظهر تنافسية في التسعير والأداء

فيما يتعلق بالتسعير، يبدأ سعر واجهة برمجة التطبيقات لـ Grok 4.6 من 2 US$ لكل مليون توكن مدخل (حوالي HK$16)، و6 US$ لكل مليون توكن مخرج (حوالي HK$47)، مما يجعله في نطاق الأسعار المتوسطة للنماذج المتقدمة، حيث يقل سعره عن نصف سعر وضع GPT-5.6 Sol القياسي. يدعم هذا النموذج نافذة سياق تصل إلى 500,000 توكن، وعندما تكون المطالبات أقل من 200,000 توكن، يتم احتساب الرسوم وفقًا للأسعار المذكورة، وبعد الوصول إلى 200,000 توكن، سترتفع الرسوم. وفقًا لما ذكرته SpaceX AI، فإن Grok 4.6 متاح بدءًا من اليوم في Grok Build، كما تم إطلاقه بالتزامن مع شركة البرمجة الذكية AI التي استحوذت عليها Cursor، وتشمل الشركاء أيضًا OpenRouter و

Vercel وCloudflare وغيرها.

على مستوى التدريب، أفادت SpaceX AI بأنه بالمقارنة مع Grok 4.5، تم تدريب Grok 4.6 لفترة أطول، وتم تعزيز التعلم المعزز في بيئات الوكلاء الذكية مثل البرمجة العامة، والعمل المعرفي، وتحسين النواة، وتطوير الويب، وتصميم الكمبيوتر المعتمد. في الاختبارات، أظهر Grok 4.6 قدرة أقوى على الاختبار الذاتي والتحقق في المهام ذات التسلسل الطويل. من حيث الكفاءة من حيث التكلفة، تظهر بيانات Artificial Analysis أن Grok 4.6 يكمل عبء العمل AA-Briefcase بمتوسط حوالي 53 جولة تفاعل و500 مليون توكن مدخل، بينما يحتاج Claude Opus 5 Max إلى حوالي 103 جولات و20

مليار توكن، مما يعكس ميزة واضحة في الكفاءة لصالح Grok 4.6.

stone
stone