برو به محتوای اصلی

مدل‌های تبدیل متن به گفتار

AI-School از مدل‌های تبدیل متن به گفتار پشتیبانی می‌کند که متن را به صوت تبدیل می‌کنند. این مدل‌ها در بخش متن به صوت در داشبورد و در قابلیت‌هایی که صوت را از چت تولید می‌کنند، استفاده می‌شوند.

فهرست فعلی

ارائه‌دهندهمدلتوضیح
OpenAIGPT-4o mini TTSگفتار طبیعی با کنترل خوب بر لحن و سبک.
GoogleGemini 3.1 Flash TTS Previewمدل گفتار جدید Gemini با کنترل دقیق بر سبک، سرعت و لحن.
AI اروپاییVoxtral Mini TTSتبدیل متن به گفتار اروپایی مبتنی بر Mistral Voxtral Mini.

Claude مدل تبدیل متن به گفتار اختصاصی در فهرست ندارد. اگر Claude به عنوان ارائه‌دهنده فعال باشد، مدل‌های گفتار به ارائه‌دهندگان دیگر پیکربندی شده وابسته خواهند بود.

گفتگوی صوتی بلادرنگ

گفتگوی صوتی از یک مدل بلادرنگ جداگانه استفاده می‌کند که گوش دادن و پاسخ دادن را در یک مکالمه زنده ترکیب می‌کند. برای OpenAI، AI-School به طور پیش‌فرض از GPT-Realtime 2.1 استفاده می‌کند. تنظیمات موجود با GPT-Realtime 1.5 یا GPT-Realtime 2 به طور خودکار به این نسخه به‌روزرسانی می‌شوند. Gemini Live به عنوان جایگزین زمانی که Google برای گفتار بلادرنگ پیکربندی شده است، در دسترس باقی می‌ماند.

آموزش زبان و زبان پشتیبانی

در یک دستیار صوتی، زبان تنظیم شده تعیین می‌کند که دستیار عمدتاً به چه زبانی صحبت کند. زبان رابط کاربری کاربر نیز به عنوان زبان پشتیبانی در دسترس باقی می‌ماند. بنابراین، یک دانش‌آموز می‌تواند مثلاً اسپانیایی تمرین کند و به طور کوتاه درخواست توضیح به زبان هلندی داشته باشد. پس از توضیح، مربی زبان دوباره به اسپانیایی بازمی‌گردد.

مربیان زبان پیش‌فرض برای هلندی، انگلیسی، آلمانی، اسپانیایی و فرانسوی برای مکالمات کوتاه در سطح A1 تنظیم شده‌اند. آن‌ها یک سوال را در هر بار مطرح می‌کنند، واژگان و سرعت را تنظیم می‌کنند و فقط اشتباهات مهم را اصلاح می‌کنند. یک دستیار صوتی ساخته شده به همین روش از پرامپت سیستم، زبان، صدا، فایل‌ها و تنظیمات ابزار خود استفاده می‌کند.

ابزارها در طول گفتگوی صوتی

دستیارهای صوتی می‌توانند، بسته به محیط و تنظیماتشان، به طور خودکار از ابزارهای فقط خواندنی برای اطلاعات اینترنتی، راهنما، چت‌های قبلی، وضعیت هوا، ویکی‌پدیا و منابع آموزشی منتخب استفاده کنند. در فرم دستیار می‌توانید یک ابزار مناسب را روشن یا خاموش کنید. ابزاری که فعال باشد در حالت خودکار قرار دارد: دستیار خودش تصمیم می‌گیرد که چه زمانی استفاده مفید است.

آنچه یک مدل گفتار تعیین می‌کند

یک مدل گفتار تعیین می‌کند که متن چگونه تلفظ شود و چه امکاناتی در دسترس باشد. مانند:

  • صداهای موجود؛
  • زبان‌هایی که یک صدا پشتیبانی می‌کند؛
  • کیفیت و طبیعی بودن تلفظ؛
  • نحوه پیروی از دستورالعمل‌ها درباره سرعت، لحن، لهجه و تلفظ.

صداها و زبان‌ها

صداهای موجود بسته به ارائه‌دهنده متفاوت هستند. AI-School در تبدیل متن به صوت فقط صداهایی را نشان می‌دهد که برای زبان انتخاب شده آزمایش شده‌اند یا صداهایی که توسط ارائه‌دهنده به عنوان چندزبانه مشخص شده‌اند. اگر یک صدا فقط برای زبان‌های خاصی در نظر گرفته شده باشد، آن زبان در کنار صدا ذکر شده است.

OpenAI و Google بیشتر زبان‌ها را در فهرست پشتیبانی می‌کنند. Voxtral Mini TTS می‌تواند چند زبان را پردازش کند، اما فهرست صدای فعلی شامل صداهای آزمایش شده برای انگلیسی و فرانسوی است. بنابراین این مدل به طور پیش‌فرض با ترکیب مناسب انگلیسی شروع می‌کند و به طور خودکار به متن هلندی متصل نمی‌شود. اگر برای زبان انتخاب شده صدای آزمایش شده‌ای موجود نباشد، AI-School هشدار می‌دهد و شما باید زبان یا مدل گفتار دیگری انتخاب کنید.

صدایی از زبان دیگر ممکن است لهجه خارجی ایجاد کند. بنابراین چنین صدای چندزبانه هرگز به طور خودکار به عنوان پیش‌فرض یا ترجیح ذخیره شده استفاده نمی‌شود. اتصال‌های فنی فقط در صورت درخواست صریح می‌توانند این کاهش کیفیت را اعمال کنند.

پرامپت سیستم

در تبدیل متن به صوت، پرامپت سیستم می‌تواند برای هدایت تلفظ و سبک استفاده شود. AI-School برای این منظور یک دستورالعمل پایه متناسب با زبان پر می‌کند. برای هلندی، این دستورالعمل شامل واکه‌ها، تأکید، ریتم و آهنگ بدون لهجه انگلیسی است. اصطلاحاتی مانند AI، AI-School، ChatGPT و OpenAI می‌توانند تلفظ انگلیسی داشته باشند و Claude به عنوان نام فرانسوی تلفظ می‌شود. شما می‌توانید دستورالعمل را برای مثال برای سرعت، لحن یا گروه هدف خاص تنظیم کنید.

کیفیت صوت و جایگزین

صدای تولید شده توسط OpenAI، Google و Mistral کنترل می‌شود و به صورت فایل استاندارد PCM16-WAV ذخیره می‌گردد. فراداده فنی شامل نرخ نمونه‌برداری، تعداد کانال‌ها، زبان، صدا و مسیر کیفیت است. این باعث می‌شود کیفیت صوت قابل کنترل باقی بماند و پاسخ غیرمعمول ارائه‌دهنده به صورت فرمت صوتی دیگری به طور ناخواسته ذخیره نشود.

دکمه خواندن متن موجود همچنین می‌تواند از صدای سیستم مرورگر یا دستگاه استفاده کند. این به عنوان کیفیت جایگزین قابل مشاهده است. برنامه در صورت امکان صدای سیستمی متناسب با زبان را انتخاب می‌کند، اما تلفظ و در دسترس بودن ممکن است بسته به دستگاه متفاوت باشد.

ترجیحات

کاربران می‌توانند تنظیمات تبدیل متن به صوت خود را به عنوان ترجیح شخصی ذخیره کنند. بنابراین نیازی نیست مدل، زبان، صدا و دستورالعمل‌های تلفظ را هر بار دوباره انتخاب کنند.

WhatsApp