تجريبي
استقبال الصوت العربي أثناء توليده
تصفّح التوثيق
صيغة الصوت والاستجابة
ترسل واجهة الكلام الصوت تدريجيًا في جسم الاستجابة بصيغة PCM خام: قناة واحدة، وعينات صحيحة موقّعة بدقة ١٦ بت، بترتيب little-endian. استخدم response_format بقيمة pcm. لا ترسل stream: true؛ الاستجابة متدفقة أصلًا.
اقرأ X-Sample-Rate من الاستجابة لمعرفة معدل التشغيل. المعدل الافتراضي ٢٤٠٠٠ هرتز. لا تفترض أن كل دفعة من الشبكة تمثل إطارًا صوتيًا كاملًا؛ احتفظ بأي بايت غير مكتمل للدفعة التالية.
لحفظ ملف WAV، أضف ترويسة WAV صحيحة بعد اكتمال الصوت، أو حوّله بأداة صوتية. تغيير امتداد الملف وحده لا يغيّر صيغته. المثال التالي يشغّل الملف الافتراضي باستخدام FFmpeg؛ عدّل المعدل إذا تغيّرت ترويسة الاستجابة.
ffplay -f s16le -ar 24000 -ac 1 speech.pcmإذا انقطع الاتصال، لا تعامل الصوت الجزئي كتسجيل مكتمل. تحقّق من حالة HTTP قبل قراءة الصوت، وتعامل مع أخطاء الطلب عبر توثيق الأخطاء.
معاملات طلب الكلام وأمثلته