أطلقت شركة شاومي نسخة جديدة من نماذج الذكاء الاصطناعي MiMo V2.5، التي تسمح بتحويل النص إلى صوت والعكس بالعكس

أطلقت شركة شاومي نسخة جديدة من نماذج الذكاء الاصطناعي MiMo V2.5، التي تسمح بتحويل النص إلى صوت والعكس بالعكس

18 software

تطلق شركة شاومي نماذج صوتية جديدة للذكاء الاصطناعي

قدمت شركة شاومي نسختين من نماذج الذكاء الاصطناعي الصوتية الخاصة بها، التي تعمل مع النص والصوت:

النموذجالوظيفةالسمات الرئيسية
MiMo‑V2.5‑TTSنص → كلام3 خيارات صوتية مجانية لفترة محدودة على MiMo Studio؛ ضبط السرعة والنبرة والعواطف؛ إمكانية إنشاء أصوات جديدة من عبارة قصيرة (VoiceDesign) واستنساخ الصوت من مجموعة صغيرة من العينات (VoiceClone).
MiMo‑V2.5‑ASRكلام → نصالتعرف على الكلام المنطوق في ظروف معقدة، دعم اللهجات الصينية + الإنجليزية؛ حوارات ثنائية اللغة ونصوص الأغاني (الفيكوال في الخلفية الموسيقية)؛ العمل في ضوضاء شديدة؛ وضع علامات الترقيم تلقائياً وفقاً للانفعالات.

كيفية استخدام MiMo‑V2.5‑TTS
1. النسخة الأساسية – يختار أحد الأصوات المسبقة ويتيح تعديل السرعة والنبرة واللون العاطفي.
2. VoiceDesign – يدخل عبارة قصيرة، ثم تُولد النغمة الجديدة للصوت.
3. VoiceClone – يحمل عدة عينات من الصوت المختار؛ يُعيد النموذج إنتاجه مع الحفاظ على الأسلوب والتعليمات.

لتحقيق التردد المطلوب يمكن للمستخدم:

- إضافة وسوم خاصة للنص؛
- وصف الصوت بلغة طبيعية بسيطة (بالصينية أو الإنجليزية)؛
- إنشاء سيناريوهات للتمثيل الافتراضي حيث تتفاعل عدة أصوات معاً في وقت واحد.

مميزات MiMo‑V2.5‑ASR
- تعدد اللغات – دعم لهجات متعددة من اللغة الصينية والإنجليزية.
- فك شفرة الأغاني – يميز النموذج الغناء حتى مع وجود موسيقى خلفية.
- مقاومة الضوضاء – التعرف الدقيق في ظروف ضوضاء شديدة.
- علامات الترقيم وفق الانفعالات – يُدرج تلقائياً علامات الترقيم، ما يقلل الحاجة للمراجعة اليدوية.

بهذا توسع شاومي قدراته في مجال تقنيات الصوت، مقدماً أدوات مرنة لإنشاء الكلام المُصطنع وكذلك للتعرف الدقيق على المعلومات المنطوقة.

التعليقات (0)

شارك أفكارك — يرجى الالتزام بالأدب والبقاء ضمن الموضوع.

لا توجد تعليقات بعد. اترك تعليقًا وشارك رأيك!

لترك تعليق، يرجى تسجيل الدخول.

سجّل الدخول للتعليق