Моделі текст-в-мову
AI-School підтримує моделі текст-в-мову, які перетворюють текст на аудіо. Ці моделі використовуються у функції Текст в аудіо на панелі керування та у функціях, що генерують аудіо з чату.
Поточний каталог
| Постачальник | Модель | Примітка |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Природне звучання з хорошим контролем тону та стилю. |
| Gemini 3.1 Flash TTS Preview | Нова модель голосу Gemini з точним контролем стилю, темпу та тону. | |
| Європейський AI | Voxtral Mini TTS | Європейський текст-в-мову на основі Mistral Voxtral Mini. |
Claude не має власної моделі текст-в-мову в каталозі. Якщо Claude увімкнено як постачальника, моделі голосу залежать від інших налаштованих постачальників.
Голосовий чат у реальному часі
Голосовий чат використовує окрему модель у реальному часі, яка поєднує прослуховування та відповіді в одному живому діалозі. Для OpenAI AI-School за замовчуванням використовує GPT-Realtime 2.1. Існуючі налаштування з GPT-Realtime 1.5 або GPT-Realtime 2 автоматично оновлюються до цієї версії. Gemini Live залишається доступним як альтернатива, коли Google налаштовано для голосу в реальному часі.
Мовне навчання та мова підтримки
У голосового асистента встановлена мова визначає, якою мовою він переважно говорить. Мова інтерфейсу користувача залишається доступною як мова підтримки. Наприклад, користувач може практикувати іспанську та коротко просити пояснення нідерландською. Після пояснення мовний тренер повертається до іспанської.
Стандартні мовні тренери для нідерландської, англійської, німецької, іспанської та французької налаштовані для коротких розмов на рівні A1. Вони ставлять по одному питанню, адаптують словниковий запас і темп, а також виправляють лише основні помилки. Саморобний голосовий асистент використовує таким самим чином власний системний запит, мову, голос, файли та налаштування інструментів.
Інструменти під час голосового чату
Голосові асистенти можуть, залежно від середовища та налаштувань, автоматично використовувати інструменти лише для читання, наприклад, для інформації з інтернету, посібника, попередніх чатів, погоди, Вікіпедії та вибраних освітніх ресурсів. У формі асистента можна увімкнути або вимкнути відповідний інструмент. Увімкнений інструмент стоїть на Автоматично: асистент сам вирішує, коли його використання корисне.
Що визначає модель голосу
Модель голосу визначає, як вимовляється текст і які можливості доступні. Наприклад:
- доступні голоси;
- мови, які підтримує голос;
- якість і природність вимови;
- спосіб виконання інструкцій щодо темпу, тону, акценту та вимови.
Голоси та мови
Доступні голоси відрізняються залежно від постачальника. AI-School показує у тексті в аудіо лише голоси, які протестовані для вибраної мови, або голоси, які постачальник позначив як багатомовні. Якщо голос призначений лише для певних мов, ця мова вказана поруч із голосом.
OpenAI та Google підтримують більшість мов у каталозі. Voxtral Mini TTS може обробляти кілька мов, але поточний каталог голосів містить протестовані голоси для англійської та французької. Тому ця модель за замовчуванням запускається з відповідною англійською комбінацією і не пов’язується мовчки з нідерландським текстом. Якщо для вибраної мови немає протестованого голосу, AI-School показує попередження, і ви можете вибрати іншу мову або іншу модель голосу.
Голос іншою мовою може викликати іноземний акцент. Такий крос-мовний голос ніколи не використовується автоматично як стандартний або збережений пріоритет. Технічні інтеграції можуть явно запитувати цей запас якості.
Системний запит
У тексті в аудіо системний запит можна використовувати для керування вимовою та стилем. AI-School заповнює відповідну мовну базову інструкцію. Для нідерландської це прохання про нідерландські голосні, наголос, ритм і інтонацію без англійського акценту. Терміни як AI, AI-School, ChatGPT та OpenAI можуть зберігати англійську вимову, а Claude вимовляється як французьке ім’я. Ви можете змінити інструкцію, наприклад, для темпу, тону або конкретної аудиторії.
Якість аудіо та запасний варіант
Згенероване аудіо від OpenAI, Google та Mistral перевіряється і зберігається у стандартизованому файлі PCM16-WAV. Технічні метадані містять частоту дискретизації, кількість каналів, мову, голос і маршрут якості. Це забезпечує контроль якості аудіо і запобігає непомітному збереженню іншого аудіоформату через відмінну відповідь постачальника.
Кнопка озвучення існуючого тексту також може використовувати системний голос браузера або пристрою. Це видно як запасну якість. Додаток за можливості вибирає системний голос, що відповідає мові, але вимова та доступність можуть відрізнятися залежно від пристрою.
Налаштування
Користувачі можуть зберігати свої налаштування текст-в-аудіо як особисті уподобання. Таким чином не потрібно щоразу повторно вибирати модель, мову, голос і інструкції з вимови.