Модели преобразования текста в речь
AI-School поддерживает модели преобразования текста в речь, которые позволяют преобразовывать текст в аудио. Эти модели используются в разделе Текст в аудио на панели управления и в функциях, генерирующих аудио из чата.
Текущий каталог
| Поставщик | Модель | Примечание |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Естественное звучание речи с хорошим управлением тоном и стилем. |
| Gemini 3.1 Flash TTS Preview | Новая модель речи Gemini с точным управлением стилем, темпом и тоном. | |
| Европейский ИИ | Voxtral Mini TTS | Европейская модель преобразования текста в речь на базе Mistral Voxtral Mini. |
Claude не имеет собственной модели преобразования текста в речь в каталоге. Если Claude включён как поставщик, модели речи зависят от остальных настроенных поставщиков.
Речевой чат в реальном времени
Речевой чат использует отдельную модель в реальном времени, которая объединяет прослушивание и ответ в одном живом разговоре. Для OpenAI AI-School по умолчанию использует GPT-Realtime 2.1. Существующие настройки с GPT-Realtime 1.5 или GPT-Realtime 2 автоматически обновляются до этой версии. Gemini Live остаётся доступным в качестве альтернативы, когда для речи в реальном времени настроен Google.
Языковая тренировка и поддерживаемый язык
Для голосового ассистента установленный язык определяет, на каком языке ассистент в основном говорит. Язык интерфейса пользователя при этом остаётся доступным как язык поддержки. Например, пользователь может практиковать испанский и кратко запрашивать объяснения на нидерландском. После объяснения языковой тренер возвращается к испанскому.
Стандартные языковые тренеры для нидерландского, английского, немецкого, испанского и французского настроены на короткие разговоры на уровне A1. Они задают по одному вопросу за раз, адаптируют словарный запас и темп, исправляют только основные ошибки. Самодельный голосовой ассистент использует таким же образом собственный системный промпт, язык, голос, файлы и настройки инструментов.
Инструменты во время речевого чата
Голосовые ассистенты могут, в зависимости от окружения и настроек, автоматически использовать инструменты только для чтения, например, для информации из интернета, руководства, предыдущих чатов, погоды, Википедии и выбранных образовательных ресурсов. В форме ассистента вы можете включать или отключать подходящий инструмент. Включённый инструмент стоит на Автоматически: тогда ассистент сам решает, когда его использование полезно.
Что определяет модель речи
Модель речи определяет, как произносится текст и какие возможности доступны. Например:
- доступные голоса;
- языки, которые поддерживает голос;
- качество и естественность произношения;
- способ выполнения инструкций по темпу, тону, акценту и произношению.
Голоса и языки
Доступные голоса различаются у разных поставщиков. AI-School при преобразовании текста в аудио показывает только голоса, протестированные для выбранного языка, или голоса, которые поставщик обозначил как многоязычные. Если голос предназначен только для определённых языков, эти языки указаны рядом с голосом.
OpenAI и Google поддерживают большинство языков в каталоге. Voxtral Mini TTS может обрабатывать несколько языков, но текущий каталог голосов содержит протестированные голоса для английского и французского. Поэтому эта модель по умолчанию запускается с подходящей английской комбинацией и не связывается молчаливо с нидерландским текстом. Если для выбранного языка нет протестированного голоса, AI-School показывает предупреждение, и вы выбираете другой язык или другую модель речи.
Голос на другом языке может вызвать иностранный акцент. Такой кросс-лингвальный голос никогда не используется автоматически как стандартный или сохранённый предпочтительный. Технические интеграции могут запрашивать этот запас качества только явно.
Системный промпт
При преобразовании текста в аудио системный промпт можно использовать для управления произношением и стилем. AI-School заполняет для этого базовую инструкцию, соответствующую языку. Для нидерландского это просьба использовать нидерландские гласные, ударение, ритм и интонацию без английского акцента. Термины, такие как AI, AI-School, ChatGPT и OpenAI, могут сохранять английское произношение, а Claude произносится как французское имя. Вы можете изменить инструкцию, например, для темпа, тона или конкретной целевой аудитории.
Качество аудио и запасной вариант
Сгенерированное аудио от OpenAI, Google и Mistral проверяется и сохраняется как стандартизированный файл PCM16-WAV. Технические метаданные содержат, среди прочего, частоту дискретизации, количество каналов, язык, голос и маршрут качества. Это позволяет контролировать качество аудио и предотвращает незаметное сохранение ответа провайдера в другом аудиоформате.
Кнопка воспроизведения для существующего текста также может использовать системный голос браузера или устройства. Это видно как запасное качество. Приложение по возможности выбирает системный голос, подходящий для языка, но произношение и доступность могут различаться в зависимости от устройства.
Предпочтения
Пользователи могут сохранять свои настройки преобразования текста в аудио как личные предпочтения. Так не нужно каждый раз заново выбирать модель, язык, голос и инструкции по произношению.