أطلقت شركة شاومي نسخة جديدة من نماذج الذكاء الاصطناعي MiMo V2.5، التي تسمح بتحويل النص إلى صوت والعكس بالعكس
تطلق شركة شاومي نماذج صوتية جديدة للذكاء الاصطناعي
قدمت شركة شاومي نسختين من نماذج الذكاء الاصطناعي الصوتية الخاصة بها، التي تعمل مع النص والصوت:
| النموذج | الوظيفة | السمات الرئيسية |
|---|---|---|
| MiMo‑V2.5‑TTS | نص → كلام | 3 خيارات صوتية مجانية لفترة محدودة على MiMo Studio؛ ضبط السرعة والنبرة والعواطف؛ إمكانية إنشاء أصوات جديدة من عبارة قصيرة (VoiceDesign) واستنساخ الصوت من مجموعة صغيرة من العينات (VoiceClone). |
| MiMo‑V2.5‑ASR | كلام → نص | التعرف على الكلام المنطوق في ظروف معقدة، دعم اللهجات الصينية + الإنجليزية؛ حوارات ثنائية اللغة ونصوص الأغاني (الفيكوال في الخلفية الموسيقية)؛ العمل في ضوضاء شديدة؛ وضع علامات الترقيم تلقائياً وفقاً للانفعالات. |
كيفية استخدام MiMo‑V2.5‑TTS
1. النسخة الأساسية – يختار أحد الأصوات المسبقة ويتيح تعديل السرعة والنبرة واللون العاطفي.
2. VoiceDesign – يدخل عبارة قصيرة، ثم تُولد النغمة الجديدة للصوت.
3. VoiceClone – يحمل عدة عينات من الصوت المختار؛ يُعيد النموذج إنتاجه مع الحفاظ على الأسلوب والتعليمات.
لتحقيق التردد المطلوب يمكن للمستخدم:
- إضافة وسوم خاصة للنص؛
- وصف الصوت بلغة طبيعية بسيطة (بالصينية أو الإنجليزية)؛
- إنشاء سيناريوهات للتمثيل الافتراضي حيث تتفاعل عدة أصوات معاً في وقت واحد.
مميزات MiMo‑V2.5‑ASR
- تعدد اللغات – دعم لهجات متعددة من اللغة الصينية والإنجليزية.
- فك شفرة الأغاني – يميز النموذج الغناء حتى مع وجود موسيقى خلفية.
- مقاومة الضوضاء – التعرف الدقيق في ظروف ضوضاء شديدة.
- علامات الترقيم وفق الانفعالات – يُدرج تلقائياً علامات الترقيم، ما يقلل الحاجة للمراجعة اليدوية.
بهذا توسع شاومي قدراته في مجال تقنيات الصوت، مقدماً أدوات مرنة لإنشاء الكلام المُصطنع وكذلك للتعرف الدقيق على المعلومات المنطوقة.
التعليقات (0)
شارك أفكارك — يرجى الالتزام بالأدب والبقاء ضمن الموضوع.
سجّل الدخول للتعليق