تقنى

أطلقت OpenAI نموذجين جديدين للتحويل الصوتي عبر API: GPT-Live-Transcribe للمحادثات الحية وGPT-Transcribe لمعالجة التسجيلات المكتملة، مع

إطلاق نموذجين جديدين للتحويل الصوتي عبر API من OpenAI وتوفير سياق أكثر دقة

OpenAI’s New Voice AI Models Improve Transcription Accuracy

كشفت OpenAI عن نموذجين جديدين للتحويل الصوتي عبر واجهة برمجة تطبيقات، هما GPT-Live-Transcribe للمحادثات الحية وGPT-Transcribe لمعالجة التسجيلات المكتملة وأحمال الدفعات غير المتزامنة. يأتي هذا مع تطويرات إضافية في إمكاناتها، وتزامن مع تحديثات سابقة في تطبيق ChatGPT Desktop الذي تلقّى ترقية رئيسية في ميزة Voice، إضافة إلى توسيع أدوات الصوت للمطورين.

ما يقدمه النموذجان للمطورين والمستخدمين

openai plus free
Image credit: OpenAI

يعتمد النموذجان على معالجة سياقية أكثر لتفريغ الصوت. يمكن للمطورين تزويد النظام بكلمات مفتاحية وأسماء ومصطلحات صناعية ولغات متوقعة لتسهيل فهم التسجيل. كما يمكن لـGPT-Live-Transcribe استخدام المحادثة السابقة كجزء من السياق أثناء الاستمرار في الحوار.

  • GPT-Live-Transcribe: مخصص لتفريغ حي منخفض التأخير للمحادثات المباشرة.
  • GPT-Transcribe: مُحسن لمعالجة التسجيلات المكتملة وأعباء الدفعات غير المتزامنة.

على مستوى الدقة، أظهرت نتائج معيار Context Aware ASR أن إضافة السياق زادت من دقة المعنى في GPT-Live-Transcribe من 38.5% إلى 44.6%، بينما سجل GPT-Transcribe ارتفاعاً من 41.6% إلى 45.2% على نفس المعيار.

أما في اختبارات الصوت الواقعي، فتم تسجيل معدلات الخطأ التالية: GPT-Live-Transcribe 9.60%، GPT-Realtime-Whisper 11.65%، GPT-Transcribe 8.98%، Whisper-1 15.21%. كما أُشير إلى قياس مستقل يقدّر معدل كلمة خطأ قدره 3.31% لـGPT-Transcribe.

تكلفة الاستخدام تُحدَّد بمعدل 4.50 دولار لكل 1,000 دقيقة من الصوت المعالج باستخدام النموذجين.

توفر إضافي وأخبار مكملة

بالإضافة إلى ذلك، أشار التحديث إلى أن تطوير أدوات الصوت للمطورين مستمر، في حين أوردت تقارير سابقة إشارات إلى تغييرات مستقبلية في مجال الذكاء الاصطناعي، مثل إعلان Microsoft عن نموذج MAI-Cyber-1-Flash لدراسة الثغرات الأمنية، وتأكيد Anthropic على عدم دعم حظر النماذج ذات الوزن المفتوح مع التعبير عن القلق من احتمالية إساءة الاستخدام.

زر الذهاب إلى الأعلى