مدلهای تبدیل متن به گفتار
AI-School از مدلهای تبدیل متن به گفتار پشتیبانی میکند که متن را به صوت تبدیل میکنند. این مدلها در بخش متن به صوت در داشبورد و در قابلیتهایی که صوت را از چت تولید میکنند، استفاده میشوند.
فهرست فعلی
| ارائهدهنده | مدل | توضیح |
|---|---|---|
| OpenAI | GPT-4o mini TTS | گفتار طبیعی با کنترل خوب بر لحن و سبک. |
| Gemini 3.1 Flash TTS Preview | مدل گفتار جدید Gemini با کنترل دقیق بر سبک، سرعت و لحن. | |
| AI اروپایی | Voxtral Mini TTS | تبدیل متن به گفتار اروپایی مبتنی بر Mistral Voxtral Mini. |
Claude مدل تبدیل متن به گفتار اختصاصی در فهرست ندارد. اگر Claude به عنوان ارائهدهنده فعال باشد، مدلهای گفتار به ارائهدهندگان دیگر پیکربندی شده وابسته خواهند بود.
گفتگوی صوتی بلادرنگ
گفتگوی صوتی از یک مدل بلادرنگ جداگانه استفاده میکند که گوش دادن و پاسخ دادن را در یک مکالمه زنده ترکیب میکند. برای OpenAI، AI-School به طور پیشفرض از GPT-Realtime 2.1 استفاده میکند. تنظیمات موجود با GPT-Realtime 1.5 یا GPT-Realtime 2 به طور خودکار به این نسخه بهروزرسانی میشوند. Gemini Live به عنوان جایگزین زمانی که Google برای گفتار بلادرنگ پیکربندی شده است، در دسترس باقی میماند.
آموزش زبان و زبان پشتیبانی
در یک دستیار صوتی، زبان تنظیم شده تعیین میکند که دستیار عمدتاً به چه زبانی صحبت کند. زبان رابط کاربری کاربر نیز به عنوان زبان پشتیبانی در دسترس باقی میماند. بنابراین، یک دانشآموز میتواند مثلاً اسپانیایی تمرین کند و به طور کوتاه درخواست توضیح به زبان هلندی داشته باشد. پس از توضیح، مربی زبان دوباره به اسپانیایی بازمیگردد.
مربیان زبان پیشفرض برای هلندی، انگلیسی، آلمانی، اسپانیایی و فرانسوی برای مکالمات کوتاه در سطح A1 تنظیم شدهاند. آنها یک سوال را در هر بار مطرح میکنند، واژگان و سرعت را تنظیم میکنند و فقط اشتباهات مهم را اصلاح میکنند. یک دستیار صوتی ساخته شده به همین روش از پرامپت سیستم، زبان، صدا، فایلها و تنظیمات ابزار خود استفاده میکند.
ابزارها در طول گفتگوی صوتی
دستیارهای صوتی میتوانند، بسته به محیط و تنظیماتشان، به طور خودکار از ابزارهای فقط خواندنی برای اطلاعات اینترنتی، راهنما، چتهای قبلی، وضعیت هوا، ویکیپدیا و منابع آموزشی منتخب استفاده کنند. در فرم دستیار میتوانید یک ابزار مناسب را روشن یا خاموش کنید. ابزاری که فعال باشد در حالت خودکار قرار دارد: دستیار خودش تصمیم میگیرد که چه زمانی استفاده مفید است.
آنچه یک مدل گفتار تعیین میکند
یک مدل گفتار تعیین میکند که متن چگونه تلفظ شود و چه امکاناتی در دسترس باشد. مانند:
- صداهای موجود؛
- زبانهایی که یک صدا پشتیبانی میکند؛
- کیفیت و طبیعی بودن تلفظ؛
- نحوه پیروی از دستورالعملها درباره سرعت، لحن، لهجه و تلفظ.
صداها و زبانها
صداهای موجود بسته به ارائهدهنده متفاوت هستند. AI-School در تبدیل متن به صوت فقط صداهایی را نشان میدهد که برای زبان انتخاب شده آزمایش شدهاند یا صداهایی که توسط ارائهدهنده به عنوان چندزبانه مشخص شدهاند. اگر یک صدا فقط برای زبانهای خاصی در نظر گرفته شده باشد، آن زبان در کنار صدا ذکر شده است.
OpenAI و Google بیشتر زبانها را در فهرست پشتیبانی میکنند. Voxtral Mini TTS میتواند چند زبان را پردازش کند، اما فهرست صدای فعلی شامل صداهای آزمایش شده برای انگلیسی و فرانسوی است. بنابراین این مدل به طور پیشفرض با ترکیب مناسب انگلیسی شروع میکند و به طور خودکار به متن هلندی متصل نمیشود. اگر برای زبان انتخاب شده صدای آزمایش شدهای موجود نباشد، AI-School هشدار میدهد و شما باید زبان یا مدل گفتار دیگری انتخاب کنید.
صدایی از زبان دیگر ممکن است لهجه خارجی ایجاد کند. بنابراین چنین صدای چندزبانه هرگز به طور خودکار به عنوان پیشفرض یا ترجیح ذخیره شده استفاده نمیشود. اتصالهای فنی فقط در صورت درخواست صریح میتوانند این کاهش کیفیت را اعمال کنند.
پرامپت سیستم
در تبدیل متن به صوت، پرامپت سیستم میتواند برای هدایت تلفظ و سبک استفاده شود. AI-School برای این منظور یک دستورالعمل پایه متناسب با زبان پر میکند. برای هلندی، این دستورالعمل شامل واکهها، تأکید، ریتم و آهنگ بدون لهجه انگلیسی است. اصطلاحاتی مانند AI، AI-School، ChatGPT و OpenAI میتوانند تلفظ انگلیسی داشته باشند و Claude به عنوان نام فرانسوی تلفظ میشود. شما میتوانید دستورالعمل را برای مثال برای سرعت، لحن یا گروه هدف خاص تنظیم کنید.
کیفیت صوت و جایگزین
صدای تولید شده توسط OpenAI، Google و Mistral کنترل میشود و به صورت فایل استاندارد PCM16-WAV ذخیره میگردد. فراداده فنی شامل نرخ نمونهبرداری، تعداد کانالها، زبان، صدا و مسیر کیفیت است. این باعث میشود کیفیت صوت قابل کنترل باقی بماند و پاسخ غیرمعمول ارائهدهنده به صورت فرمت صوتی دیگری به طور ناخواسته ذخیره نشود.
دکمه خواندن متن موجود همچنین میتواند از صدای سیستم مرورگر یا دستگاه استفاده کند. این به عنوان کیفیت جایگزین قابل مشاهده است. برنامه در صورت امکان صدای سیستمی متناسب با زبان را انتخاب میکند، اما تلفظ و در دسترس بودن ممکن است بسته به دستگاه متفاوت باشد.
ترجیحات
کاربران میتوانند تنظیمات تبدیل متن به صوت خود را به عنوان ترجیح شخصی ذخیره کنند. بنابراین نیازی نیست مدل، زبان، صدا و دستورالعملهای تلفظ را هر بار دوباره انتخاب کنند.