أطلقت شركة شاومي نموذج OmniVoice، وهو نموذج ذكاء اصطناعي مفتوح يمكنه تحويل النصوص إلى صوت تقريباً بجميع اللغات ويستطيع نسخ الأصوات.
شركة شاومي أطلقت وحدة الذكاء الاصطناعي المفتوحة OmniVoice
أعلنت الشركة عن إطلاق نموذج الذكاء الاصطناعي OmniVoice، الذي يحوّل النص إلى كلام. بالإضافة إلى توليد الصوت في مئات اللغات، يمكن للنموذج تكرار الأصوات وتوليد النطق مع إعدادات مخصصة للمستخدم.
ما الجديد في OmniVoice؟
المؤشر الوصف اللغات
دعم أكثر من 200 لغة، بما في ذلك اللغات النادرة وقليلة التدريب. حتى مع وجود أقل من 10 ساعات بيانات، ينتج النموذج كلامًا «تقريباً بأي لغة».
الجودة في اختبارات على 102 لغة، كان وضوح الكلام مماثلًا للإنسان، وفي بعض الحالات أفضل منه. على 24 لغة تجاوز النموذج عدة أنظمة تجارية في التشابه والوضوح.
العمارة
شبكة تحويل ثنائية الاتجاه مبسطة بدون وحدات وسيطة لتوقع الرموز. يقلل ذلك من وقت التدريب إلى يوم واحد لبيانات 100,000 ساعة ويزيد سرعة الاستنتاج (حتى 40× السرعة الفعلية في PyTorch).
التقنيات
• «إخفاء عشوائي للرموز الصوتية» يسرّع التدريب.
• توصيل نموذج لغوي كبير أثناء التدريب المسبق يحسن النطق والوضوح.
القدرات العملية
1. تكرار الصوت
- توليد الكلام وفقًا للخصائص المحددة (العمر، الجنس، النغمة، اللكنة، اللهجة).
- إمكانية إنشاء همس وأنماط أسلوبية أخرى بدون صوت مرجعي.
2. معالجة التسجيلات الأصلية
- إزالة الضوضاء واستخراج خصائص الصوت الصافية حتى من ملفات غير مثالية.
3. إدارة النبرة
- إضافة أنفاس، ضحك وتفاصيل أخرى لجعل الصوت أكثر طبيعية.
4. تصحيح دقيق للنطق
- ضبط يدوي للرموز المعقدة، مثل الأحرف الصينية متعددة الأصوات أو الأسماء الإنجليزية الخاصة.
النتائج
يُعد OmniVoice بديلاً تنافسياً للأنظمة التجارية الحالية لتوليد الكلام. بفضل تصميمه البسيط، وسرعة التدريب والاستنتاج العالية، وإمكانيات التخصيص الواسعة، فإن النموذج جاهز للتكامل في تطبيقات وخدمات المستهلكين.
التعليقات (0)
شارك أفكارك — يرجى الالتزام بالأدب والبقاء ضمن الموضوع.
سجّل الدخول للتعليق