Modelli di testo in voce
AI-School supporta modelli di testo in voce che permettono di convertire il testo in audio. Questi modelli sono utilizzati in Testo in audio nella dashboard e nelle funzioni che generano audio da una chat.
Catalogo attuale
| Fornitore | Modello | Nota |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Voce naturale con buon controllo su tono e stile. |
| Gemini 3.1 Flash TTS Preview | Nuovo modello vocale Gemini con controllo preciso su stile, ritmo e tono. | |
| AI Europea | Voxtral Mini TTS | Text-to-speech europeo basato su Mistral Voxtral Mini. |
Claude non ha un proprio modello di testo in voce nel catalogo. Se Claude è abilitato come fornitore, i modelli vocali dipendono dagli altri fornitori configurati.
Chat vocale in tempo reale
La chat vocale usa un modello separato in tempo reale che combina ascolto e risposta in una singola conversazione live. Per OpenAI, AI-School usa di default GPT-Realtime 2.1. Le impostazioni esistenti con GPT-Realtime 1.5 o GPT-Realtime 2 vengono aggiornate automaticamente a questa versione. Gemini Live rimane disponibile come alternativa quando Google è configurato per la voce in tempo reale.
Addestramento linguistico e lingua di supporto
In un assistente vocale, la lingua impostata determina in quale lingua l'assistente parla principalmente. La lingua dell'interfaccia utente rimane disponibile come lingua di supporto. Un utente può così, per esempio, esercitarsi in spagnolo e chiedere brevi spiegazioni in olandese. Dopo la spiegazione, il trainer linguistico torna allo spagnolo.
I trainer linguistici standard per olandese, inglese, tedesco, spagnolo e francese sono progettati per brevi conversazioni a livello A1. Fanno una domanda alla volta, adattano il vocabolario e il ritmo e correggono solo gli errori principali. Un assistente vocale personalizzato usa allo stesso modo il proprio prompt di sistema, lingua, voce, file e impostazioni degli strumenti.
Strumenti durante la chat vocale
Gli assistenti vocali possono, a seconda dell'ambiente e delle loro impostazioni, usare automaticamente strumenti in sola lettura per informazioni da internet, manuali, chat precedenti, meteo, Wikipedia e risorse educative selezionate. Nel modulo assistente puoi attivare o disattivare uno strumento adatto. Uno strumento attivato è su Automatico: l'assistente decide quando è utile usarlo.
Cosa determina un modello vocale
Un modello vocale determina come il testo viene pronunciato e quali funzionalità sono disponibili. Per esempio:
- le voci disponibili;
- le lingue supportate da una voce;
- la qualità e naturalezza della pronuncia;
- il modo in cui vengono seguite le istruzioni su ritmo, tono, accento e pronuncia.
Voci e lingue
Le voci disponibili variano per fornitore. AI-School mostra per testo in audio solo le voci testate per la lingua scelta, o voci indicate dal fornitore come multilingue. Se una voce è destinata solo a certe lingue, queste sono indicate accanto alla voce.
OpenAI e Google supportano la maggior parte delle lingue nel catalogo. Voxtral Mini TTS può gestire più lingue, ma l'attuale catalogo vocale contiene voci testate per inglese e francese. Perciò questo modello parte di default con una combinazione inglese adatta e non viene associato silenziosamente a testo olandese. Se per una lingua scelta non è disponibile una voce testata, AI-School mostra un avviso e puoi scegliere un'altra lingua o un altro modello vocale.
Una voce in un'altra lingua può causare un accento straniero. Una voce cross-lingual non viene mai usata automaticamente come predefinita o preferenza salvata. Le integrazioni tecniche possono richiedere esplicitamente questo fallback di qualità.
Prompt di sistema
Nel testo in audio il prompt di sistema può essere usato per guidare pronuncia e stile. AI-School inserisce una istruzione base adatta alla lingua. Per l’olandese chiede vocali olandesi, accento, ritmo e intonazione senza accento inglese. Termini come AI, AI-School, ChatGPT e OpenAI possono mantenere la pronuncia inglese e Claude viene pronunciato come nome francese. Puoi modificare l’istruzione per esempio per ritmo, tono o un pubblico specifico.
Qualità audio e fallback
L’audio generato da OpenAI, Google e Mistral viene controllato e salvato come file PCM16-WAV standardizzato. I metadati tecnici includono frequenza di campionamento, numero di canali, lingua, voce e percorso di qualità. Questo mantiene la qualità audio controllabile e impedisce che una risposta del provider diversa venga salvata silenziosamente in un altro formato audio.
Il pulsante di lettura per testo esistente può anche usare la voce di sistema del browser o del dispositivo. Questo è visibile come qualità di fallback. L’app sceglie dove possibile una voce di sistema adatta alla lingua, ma pronuncia e disponibilità possono variare per dispositivo.
Preferenze
Gli utenti possono salvare le loro impostazioni di testo in audio come preferenze personali. Così non devono scegliere ogni volta modello, lingua, voce e istruzioni di pronuncia.