Modelos de texto a voz
AI-School soporta modelos de texto a voz que permiten convertir texto en audio. Estos modelos se utilizan en Texto a audio en el panel de control y en funciones que generan audio desde un chat.
Catálogo actual
| Proveedor | Modelo | Comentario |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Voz natural con buen control de tono y estilo. |
| Gemini 3.1 Flash TTS Preview | Nuevo modelo de voz Gemini con control preciso de estilo, ritmo y tono. | |
| Europea AI | Voxtral Mini TTS | Texto a voz europeo basado en Mistral Voxtral Mini. |
Claude no tiene un modelo de texto a voz propio en el catálogo. Si Claude está habilitado como proveedor, los modelos de voz dependen de los demás proveedores configurados.
Chat de voz en tiempo real
El chat de voz usa un modelo en tiempo real separado que combina escuchar y responder en una conversación en vivo. Para OpenAI, AI-School usa por defecto GPT-Realtime 2.1. Las configuraciones existentes con GPT-Realtime 1.5 o GPT-Realtime 2 se actualizan automáticamente a esta versión. Gemini Live sigue disponible como alternativa cuando Google está configurado para voz en tiempo real.
Entrenamiento de idioma y idioma de soporte
En un asistente de voz, el idioma configurado determina en qué idioma habla principalmente el asistente. Además, el idioma de la interfaz del usuario permanece disponible como idioma de soporte. Por ejemplo, un alumno puede practicar español y pedir brevemente explicaciones en neerlandés. Después de la explicación, el entrenador de idiomas vuelve al español.
Los entrenadores de idioma estándar para neerlandés, inglés, alemán, español y francés están diseñados para conversaciones cortas en nivel A1. Hacen una pregunta a la vez, ajustan vocabulario y ritmo, y corrigen solo los errores más importantes. Un asistente de voz personalizado usa de la misma forma su propio prompt del sistema, idioma, voz, archivos y configuraciones de herramientas.
Herramientas durante el chat de voz
Los asistentes de voz pueden, según el entorno y sus configuraciones, usar automáticamente herramientas de solo lectura para, por ejemplo, información de internet, el manual, chats anteriores, el clima, Wikipedia y fuentes educativas seleccionadas. En el formulario del asistente puedes activar o desactivar una herramienta adecuada. Una herramienta activada está en Automático: el asistente decide cuándo es útil usarla.
Qué determina un modelo de voz
Un modelo de voz determina cómo se pronuncia el texto y qué posibilidades están disponibles. Por ejemplo:
- las voces disponibles;
- los idiomas que soporta una voz;
- la calidad y naturalidad de la pronunciación;
- la forma en que se siguen las instrucciones sobre ritmo, tono, acento y pronunciación.
Voces e idiomas
Las voces disponibles varían según el proveedor. AI-School muestra en texto a audio solo voces que han sido probadas para el idioma elegido, o voces que el proveedor ha marcado como multilingües. Si una voz está destinada solo para ciertos idiomas, ese idioma se indica junto a la voz.
OpenAI y Google soportan la mayoría de idiomas en el catálogo. Voxtral Mini TTS puede procesar varios idiomas, pero el catálogo actual de voces contiene voces probadas para inglés y francés. Por eso este modelo inicia por defecto con una combinación inglesa adecuada y no se asocia silenciosamente a texto en neerlandés. Si no hay una voz probada para un idioma elegido, AI-School muestra una advertencia y debes elegir otro idioma o modelo de voz.
Una voz de otro idioma puede causar un acento extranjero. Por eso una voz cross-lingual nunca se usa automáticamente como predeterminada o preferencia guardada. Las integraciones técnicas solo pueden solicitar explícitamente esta opción de calidad inferior.
Prompt del sistema
En texto a audio se puede usar el prompt del sistema para controlar la pronunciación y el estilo. AI-School rellena una instrucción base adecuada al idioma. Para neerlandés, pide vocales neerlandesas, acento, ritmo e entonación sin acento inglés. Términos como AI, AI-School, ChatGPT y OpenAI pueden mantener pronunciación inglesa y Claude se pronuncia como nombre francés. Puedes ajustar la instrucción para ritmo, tono o un público específico.
Calidad de audio y fallback
El audio generado por OpenAI, Google y Mistral se verifica y se guarda como archivo PCM16-WAV estandarizado. Los metadatos técnicos incluyen frecuencia de muestreo, número de canales, idioma, voz y ruta de calidad. Así la calidad del audio es controlable y una respuesta diferente del proveedor no se guarda inadvertidamente en otro formato de audio.
El botón de lectura en texto existente también puede usar la voz del sistema del navegador o dispositivo. Esto se muestra como calidad fallback. La aplicación elige cuando es posible una voz del sistema que coincida con el idioma, pero la pronunciación y disponibilidad pueden variar según el dispositivo.
Preferencias
Los usuarios pueden guardar sus configuraciones de texto a audio como preferencia personal. Así no tienen que elegir modelo, idioma, voz e instrucciones de pronunciación cada vez.