أعلنت شركة Xiaomi رسميًا عن إصدار وفتح مصدر نموذج التعرف على الصوت الخاص بالمتحدثين الصناعيين Xiaomi-CocktailASR-1، وقد تم الإعلان عن هذا الخبر في 11 سبتمبر. وفقًا لمعلومات الحساب الرسمي لشركة Xiaomi على Weibo، تم تصميم هذا النموذج خصيصًا لمشاهد الصوت المعقدة حيث يتحدث عدة أشخاص في نفس الوقت، ويركز على حل مشكلة “حفلة الكوكتيل” في التعرف على الصوت، أي التعرف على محتوى صوت المستخدم المستهدف من بين عدة متحدثين في بيئة صاخبة.
وفقًا لشركة Xiaomi، يعتمد Xiaomi-CocktailASR-1 على بنية LLM من طرف إلى طرف، ويستخدم مقطع صوتي مرجعي للمتحدث المستهدف كإشارة صوتية، مما يمكنه من استخراج وتدوين محتوى المتحدث المستهدف فقط في حالة تداخل الكلام بين عدة أشخاص. وأشارت الشركة إلى أن هذا النموذج تم تدريبه على بيانات متعددة المتحدثين على نطاق واسع، وقد حقق أداءً ممتازًا في عدة مجموعات اختبار رئيسية مثل AliMeeting وAMI وLibriMix.
Xiaomi-CocktailASR-1 يتمتع بقدرة التعرف على الصوت من عدة متحدثين
في الوقت نفسه، فإن أدائه في مشاهد المتحدث الواحد يمكن أن ينافس نماذج ASR الفردية الرائجة، حيث يمكنه التعامل مع مشاهد المتحدث الواحد والمتحدثين المتعددين باستخدام نفس النموذج، دون الحاجة للتبديل بين نماذج التعرف على الصوت المختلفة. بالإضافة إلى ذلك، يتمتع هذا النموذج بقدرة على رفض العينات السلبية، حيث يمكنه إخراج نص فارغ في حالة عدم وجود المتحدث المستهدف في الصوت، مما يقلل من مخاطر التعرف الخاطئ والتنبيهات غير المرغوب فيها الناتجة عن الصوت غير المستهدف.
كما ذكرت شركة Xiaomi أن Xiaomi-CocktailASR-1 يدعم وضع استدلال سلسلة التفكير، مما يوفر عملية استدلال قابلة للتفسير لنتائج التعرف. حاليًا، تم فتح مصدر أوزان النموذج وكود الاستدلال الخاص بـ Xiaomi-CocktailASR-1.

