قدمت OpenAI نموذج GPT‑Realtime‑2 ونسختين صوتيتين جديدتين متاحتين فقط عبر واجهة برمجة التطبيقات (API)
توسّع OpenAI إمكانيات واجهة برمجة تطبيقات الصوت
أعلنت الشركة عن إطلاق ميزات جديدة لواجهة برمجة التطبيقات الخاصة بها، التي ستمكّن المطورين من إنشاء تطبيقات صوتية أكثر «حيوية»: يمكنهم التحدث مع المستخدمين، تحويل الكلام إلى نص وترجمة المحادثات في الوقت الفعلي.
النماذج الجديدة Realtime
من خلال واجهة Realtime أصبحت متاحة الآن ثلاث نماذج:
| نموذج | الغرض | الميزات الرئيسية |
|---|---|---|
| GPT‑Realtime‑2 | التفاعل الصوتي في الوقت الحقيقي | تحليل الطلبات، استدعاء الأدوات، معالجة التصحيحات واستمرار الحوار بسلاسة. مبني على منطق GPT‑5، مما يتيح التعامل مع مهام أكثر تعقيداً مقارنة بـ GPT‑Realtime‑1.5. |
| GPT‑Realtime‑Translate | الترجمة في الوقت الحقيقي | يدعم 70+ لغة إدخال و13 لغة إخراج. يحافظ على المعنى حتى عند تغيير السياق أو اللهجات الإقليمية أو المصطلحات المتخصصة. |
| GPT‑Realtime‑Whisper | نسخ الكلام إلى نص | نموذج تدفق منخفض التأخير، يحوّل الصوت إلى نص تقريباً فورياً. |
> «نماذجنا الجديدة تُحوِّل الصوت في الوقت الحقيقي من حوار بسيط إلى واجهات صوتية يمكنها فعلاً العمل: الاستماع، التفكير، الترجمة، النسخ واتخاذ إجراءات أثناء تطور المحادثة»، قالت الشركة.
التكلفة
النموذج | السعر
---|---
GPT‑Realtime‑2 | 32 دولاراً لكل مليون توكين صوتي مدخل، 0.40 دولاراً لكل مليون توكين مخزّن و64 دولاراً لكل مليون توكين صوتي مخرج
GPT‑Realtime‑Translate | 0.034 دولاراً في الدقيقة
GPT‑Realtime‑Whisper | 0.017 دولاراً في الدقيقة
كيف تجربها
يمكن للمطورين اختبار النماذج الجديدة على منصة OpenAI Playground عبر الإنترنت ورؤية كيفية عملها في الوقت الحقيقي مباشرةً.
التعليقات (0)
شارك أفكارك — يرجى الالتزام بالأدب والبقاء ضمن الموضوع.
سجّل الدخول للتعليق