نماذج تحويل النص إلى كلام
يدعم AI-School نماذج تحويل النص إلى كلام التي تحول النص إلى صوت. تُستخدم هذه النماذج في النص إلى صوت على لوحة التحكم وفي الوظائف التي تولد صوتًا من الدردشة.
الكتالوج الحالي
| المزود | النموذج | ملاحظة |
|---|---|---|
| OpenAI | GPT-4o mini TTS | كلام طبيعي مع تحكم جيد في النغمة والأسلوب. |
| Gemini 3.1 Flash TTS Preview | نموذج كلام Gemini جديد مع تحكم دقيق في الأسلوب والسرعة والنغمة. | |
| الذكاء الاصطناعي الأوروبي | Voxtral Mini TTS | تحويل نص إلى كلام أوروبي يعتمد على Mistral Voxtral Mini. |
لا يمتلك Claude نموذج تحويل نص إلى كلام خاص به في الكتالوج. إذا تم تفعيل Claude كمزود، تظل نماذج الكلام تعتمد على المزودين الآخرين المكونين.
الدردشة الصوتية في الوقت الحقيقي
تستخدم الدردشة الصوتية نموذجًا منفصلًا في الوقت الحقيقي يجمع بين الاستماع والرد في محادثة مباشرة واحدة. يستخدم AI-School بشكل افتراضي GPT-Realtime 2.1 لـ OpenAI. يتم تحديث الإعدادات الحالية التي تستخدم GPT-Realtime 1.5 أو GPT-Realtime 2 تلقائيًا إلى هذا الإصدار. يظل Gemini Live متاحًا كبديل عندما يتم تكوين Google للصوت في الوقت الحقيقي.
تدريب اللغة ولغة الدعم
في مساعد الصوت، تحدد اللغة المضبوطة اللغة التي يتحدث بها المساعد بشكل رئيسي. تظل لغة واجهة المستخدم متاحة كلغة دعم. على سبيل المثال، يمكن للمتعلم ممارسة الإسبانية وطلب شرح قصير باللغة الهولندية. بعد الشرح، يعود مدرب اللغة إلى الإسبانية.
تم إعداد مدربي اللغة الافتراضيين للهولندية والإنجليزية والألمانية والإسبانية والفرنسية لمحادثات قصيرة على مستوى A1. يطرحون سؤالًا واحدًا في كل مرة، ويضبطون المفردات والسرعة، ويصححون فقط الأخطاء الرئيسية. يستخدم مساعد صوتي مخصص بنفس الطريقة مطالبه النظامية الخاصة، واللغة، والصوت، والملفات، وإعدادات الأدوات.
الأدوات أثناء الدردشة الصوتية
يمكن لمساعدي الصوت، حسب البيئة وإعداداتهم، استخدام أدوات للقراءة فقط تلقائيًا لمعلومات الإنترنت، والدليل، والدردشات السابقة، والطقس، وويكيبيديا، والمصادر التعليمية المختارة. في نموذج المساعد، يمكنك تشغيل أو إيقاف أداة مناسبة. تكون الأداة المفعلة على تلقائي: يقرر المساعد بنفسه متى يكون الاستخدام مفيدًا.
ما يحدده نموذج الصوت
يحدد نموذج الصوت كيفية نطق النص والميزات المتاحة. فكر في:
- الأصوات المتاحة؛
- اللغات التي يدعمها الصوت؛
- جودة وطبيعية النطق؛
- الطريقة التي يتم بها اتباع التعليمات المتعلقة بالسرعة، والنغمة، واللهجة، والنطق.
الأصوات واللغات
تختلف الأصوات المتاحة حسب المزود. يعرض AI-School في النص إلى صوت فقط الأصوات التي تم اختبارها للغة المختارة، أو الأصوات التي صنفها المزود على أنها متعددة اللغات. إذا كان الصوت مخصصًا فقط لبعض اللغات، يتم ذكر تلك اللغة بجانب الصوت.
يدعم OpenAI وGoogle معظم اللغات في الكتالوج. يمكن لـ Voxtral Mini TTS معالجة عدة لغات، لكن كتالوج الأصوات الحالي يحتوي على أصوات مختبرة للإنجليزية والفرنسية فقط. لذلك يبدأ هذا النموذج افتراضيًا بمزيج إنجليزي مناسب ولا يتم ربطه ضمنيًا بالنص الهولندي. إذا لم يتوفر صوت مختبر للغة المختارة، يعرض AI-School تحذيرًا وتختار لغة أخرى أو نموذج صوت آخر.
يمكن أن يسبب صوت من لغة أخرى لهجة أجنبية. لذلك، لا يُستخدم صوت متعدد اللغات تلقائيًا كإعداد افتراضي أو تفضيل محفوظ. يمكن للربط التقني طلب هذا التراجع في الجودة صراحةً فقط.
مطالبة النظام
في النص إلى صوت، يمكن استخدام مطالبة النظام لتوجيه النطق والأسلوب. يملأ AI-School تعليمات أساسية مناسبة للغة. بالنسبة للهولندية، تطلب هذه التعليمات حروف العلة الهولندية، والتوكيد، والإيقاع، والتنغيم بدون لهجة إنجليزية. يمكن للكلمات مثل AI، AI-School، ChatGPT وOpenAI أن تحتفظ بالنطق الإنجليزي، ويتم نطق Claude كاسم فرنسي. يمكنك تعديل التعليمات للسرعة، أو النغمة، أو جمهور معين.
جودة الصوت والتراجع
يتم فحص الصوت المولد من OpenAI وGoogle وMistral ويتم تخزينه كملف PCM16-WAV موحد. تحتوي البيانات الوصفية التقنية على تردد العينة، وعدد القنوات، واللغة، والصوت، ومسار الجودة. هذا يحافظ على إمكانية التحقق من جودة الصوت ولا يتم تخزين استجابة مزود مختلفة بصمت كتنسيق صوت آخر.
يمكن لزر القراءة في النص الموجود استخدام صوت النظام في المتصفح أو الجهاز. يظهر هذا كجودة تراجع. تختار التطبيق صوت نظام مناسب للغة حيثما أمكن، لكن النطق والتوفر قد يختلفان حسب الجهاز.
التفضيلات
يمكن للمستخدمين حفظ إعدادات النص إلى صوت كتفضيلات شخصية. بذلك لا يحتاجون إلى اختيار النموذج، اللغة، الصوت، وتعليمات النطق في كل مرة.