Sari la conținutul principal

Modele text-în-vorbire

AI-School suportă modele text-în-vorbire care pot converti textul în audio. Aceste modele sunt utilizate în Text în audio pe tabloul de bord și în funcțiile care generează audio dintr-un chat.

Catalogul curent

FurnizorModelObservație
OpenAIGPT-4o mini TTSVorbire cu sunet natural și control bun asupra tonului și stilului.
GoogleGemini 3.1 Flash TTS PreviewModel nou Gemini pentru vorbire cu control precis asupra stilului, ritmului și tonului.
AI EuropeanăVoxtral Mini TTSText-to-speech european bazat pe Mistral Voxtral Mini.

Claude nu are un model text-în-vorbire propriu în catalog. Dacă Claude este activat ca furnizor, modelele de vorbire depind în continuare de ceilalți furnizori configurați.

Chat vocal în timp real

Chatul vocal folosește un model separat în timp real care combină ascultarea și răspunsul într-o singură conversație live. Pentru OpenAI, AI-School folosește implicit GPT-Realtime 2.1. Setările existente cu GPT-Realtime 1.5 sau GPT-Realtime 2 sunt actualizate automat la această versiune. Gemini Live rămâne disponibil ca alternativă când Google este configurat pentru vorbire în timp real.

Antrenament lingvistic și limbă de suport

La un asistent vocal, limba setată determină limba principală în care vorbește asistentul. Limba interfeței utilizatorului rămâne disponibilă ca limbă de suport. Astfel, un elev poate exersa spaniola și poate cere scurt explicații în olandeză. După explicație, antrenorul lingvistic revine la spaniolă.

Antrenorii lingvistici standard pentru olandeză, engleză, germană, spaniolă și franceză sunt concepuți pentru conversații scurte la nivel A1. Ei pun o singură întrebare pe rând, adaptează vocabularul și ritmul și corectează doar cele mai importante greșeli. Un asistent vocal personalizat folosește în același mod promptul său de sistem, limba, vocea, fișierele și setările instrumentelor.

Instrumente în timpul chatului vocal

Asistenții vocali pot, în funcție de mediu și setările lor, să folosească automat instrumente doar pentru citire, pentru informații de pe internet, manual, chaturi anterioare, vreme, Wikipedia și surse educaționale selectate. În formularul asistentului activezi sau dezactivezi un instrument potrivit. Un instrument activat este pe Automat: asistentul decide singur când este util să îl folosească.

Ce determină un model vocal

Un model vocal determină cum este pronunțat textul și ce funcționalități sunt disponibile. De exemplu:

  • vocile disponibile;
  • limbile pe care le suportă o voce;
  • calitatea și naturalitatea pronunției;
  • modul în care sunt respectate instrucțiunile privind ritmul, tonul, accentul și pronunția.

Voci și limbi

Vocile disponibile diferă în funcție de furnizor. AI-School afișează la text în audio doar vocile testate pentru limba aleasă sau vocile marcate de furnizor ca fiind multilingve. Dacă o voce este destinată doar anumitor limbi, acea limbă este menționată lângă voce.

OpenAI și Google suportă majoritatea limbilor din catalog. Voxtral Mini TTS poate procesa mai multe limbi, dar catalogul actual de voci conține voci testate pentru engleză și franceză. De aceea, acest model pornește implicit cu o combinație potrivită în engleză și nu este asociat tacit cu textul în olandeză. Dacă pentru o limbă aleasă nu există o voce testată disponibilă, AI-School afișează un avertisment și alegi o altă limbă sau un alt model vocal.

O voce dintr-o altă limbă poate cauza un accent străin. O astfel de voce cross-lingual nu este folosită niciodată automat ca implicită sau preferință salvată. Legăturile tehnice pot solicita explicit această soluție de rezervă pentru calitate.

Prompt de sistem

La text în audio, promptul de sistem poate fi folosit pentru a controla pronunția și stilul. AI-School completează o instrucțiune de bază potrivită limbii. Pentru olandeză, aceasta cere vocale olandeze, accent, ritm și intonație fără accent englezesc. Termeni precum AI, AI-School, ChatGPT și OpenAI pot păstra pronunția engleză, iar Claude este pronunțat ca un nume francez. Poți ajusta instrucțiunea pentru ritm, ton sau un public țintă specific.

Calitatea audio și fallback

Audio generat de OpenAI, Google și Mistral este verificat și salvat ca fișier PCM16-WAV standardizat. Metadatele tehnice includ frecvența de eșantionare, numărul de canale, limba, vocea și ruta de calitate. Astfel, calitatea audio rămâne verificabilă și un răspuns diferit al furnizorului nu este salvat neobservat ca un alt format audio.

Butonul de citire pentru textul existent poate folosi și vocea sistemului browserului sau dispozitivului. Aceasta este vizibilă ca fallback de calitate. Aplicația alege, dacă este posibil, o voce de sistem potrivită limbii, dar pronunția și disponibilitatea pot varia în funcție de dispozitiv.

Preferințe

Utilizatorii își pot salva setările text-în-audio ca preferințe personale. Astfel, modelul, limba, vocea și instrucțiunile de pronunție nu trebuie alese de fiecare dată.

WhatsApp