Ga naar hoofdinhoud

Tekst-naar-spraakmodellen

AI-School ondersteunt tekst-naar-spraakmodellen waarmee tekst kan worden omgezet naar audio. Deze modellen worden gebruikt bij Tekst naar audio op het dashboard en bij functies die audio genereren vanuit een chat.

Huidige catalogus

AanbiederModelOpmerking
OpenAIGPT-4o mini TTSNatuurlijk klinkende spraak met goede sturing op toon en stijl.
GoogleGemini 3.1 Flash TTS PreviewNieuw Gemini-spraakmodel met nauwkeurige sturing op stijl, tempo en toon.
Europese AIVoxtral Mini TTSEuropese text-to-speech op basis van Mistral Voxtral Mini.

Claude heeft geen eigen tekst-naar-spraakmodel in de catalogus. Als Claude als aanbieder is ingeschakeld, blijven spraakmodellen afhankelijk van de overige geconfigureerde aanbieders.

Realtime spraakchat

Spraakchat gebruikt een apart realtime model dat luisteren en antwoorden in één live gesprek combineert. Voor OpenAI gebruikt AI-School standaard GPT-Realtime 2.1. Bestaande instellingen met GPT-Realtime 1.5 of GPT-Realtime 2 worden automatisch naar deze versie bijgewerkt. Gemini Live blijft beschikbaar als alternatief wanneer Google voor realtime spraak is geconfigureerd.

Taaltraining en ondersteuningstaal

Bij een spraakassistent bepaalt de ingestelde taal in welke taal de assistent hoofdzakelijk spreekt. De interfacetaal van de gebruiker blijft daarnaast beschikbaar als ondersteuningstaal. Een leerling kan daardoor bijvoorbeeld Spaans oefenen en kort om Nederlandse uitleg vragen. Na de uitleg schakelt de taaltrainer weer terug naar het Spaans.

De standaard taaltrainers voor Nederlands, Engels, Duits, Spaans en Frans zijn ingericht voor korte gesprekken op A1-niveau. Ze stellen één vraag tegelijk, passen woordenschat en tempo aan en verbeteren alleen de belangrijkste fouten. Een zelfgemaakte spraakassistent gebruikt op dezelfde manier zijn eigen systeemprompt, taal, stem, bestanden en toolinstellingen.

Tools tijdens spraakchat

Spraakassistenten kunnen, afhankelijk van de omgeving en hun instellingen, automatisch alleen-lezen-tools gebruiken voor bijvoorbeeld internetinformatie, de handleiding, eerdere chats, het weer, Wikipedia en geselecteerde onderwijsbronnen. In het assistentformulier zet je een geschikte tool aan of uit. Een ingeschakelde tool staat op Automatisch: de assistent beslist dan zelf wanneer gebruik nuttig is.

Wat een spraakmodel bepaalt

Een spraakmodel bepaalt hoe tekst wordt uitgesproken en welke mogelijkheden beschikbaar zijn. Denk aan:

  • de beschikbare stemmen;
  • de talen die een stem ondersteunt;
  • de kwaliteit en natuurlijkheid van de uitspraak;
  • de manier waarop instructies over tempo, toon, accent en uitspraak worden opgevolgd.

Stemmen en talen

De beschikbare stemmen verschillen per aanbieder. AI-School toont bij tekst naar audio alleen stemmen die getest zijn voor de gekozen taal, of stemmen die door de aanbieder als meertalig zijn aangemerkt. Als een stem alleen voor bepaalde talen bedoeld is, staat die taal bij de stem vermeld.

OpenAI en Google ondersteunen de meeste talen in de catalogus. Voxtral Mini TTS kan meerdere talen verwerken, maar de huidige stemcatalogus bevat geteste stemmen voor Engels en Frans. Daarom start dit model standaard met een passende Engelse combinatie en wordt het niet stilzwijgend gekoppeld aan Nederlandse tekst. Als voor een gekozen taal geen geteste stem beschikbaar is, toont AI-School een waarschuwing en kies je een andere taal of een ander spraakmodel.

Een stem uit een andere taal kan een buitenlands accent veroorzaken. Zo'n cross-lingual stem wordt daarom nooit automatisch als standaard of opgeslagen voorkeur gebruikt. Technische koppelingen kunnen deze kwaliteitsfallback alleen expliciet aanvragen.

Systeemprompt

Bij tekst naar audio kan de systeemprompt worden gebruikt om de uitspraak en stijl te sturen. AI-School vult daarvoor een taalpassende basisinstructie in. Voor Nederlands vraagt die om Nederlandse klinkers, klemtoon, ritme en intonatie zonder Engels accent. Termen als AI, AI-School, ChatGPT en OpenAI mogen een Engelse uitspraak houden en Claude wordt als Franse naam uitgesproken. Je kunt de instructie aanpassen voor bijvoorbeeld tempo, toon of een specifieke doelgroep.

Audiokwaliteit en fallback

Gegenereerde audio van OpenAI, Google en Mistral wordt gecontroleerd en als gestandaardiseerd PCM16-WAV-bestand opgeslagen. De technische metadata bevat onder meer samplefrequentie, aantal kanalen, taal, stem en kwaliteitsroute. Daardoor blijft de audiokwaliteit controleerbaar en wordt een afwijkende providerrespons niet ongemerkt als een ander audioformaat opgeslagen.

De voorleesknop bij bestaande tekst kan ook de systeemstem van de browser of het apparaat gebruiken. Dit is zichtbaar als fallbackkwaliteit. De applicatie kiest waar mogelijk een systeemstem die bij de taal past, maar uitspraak en beschikbaarheid kunnen per apparaat verschillen.

Voorkeuren

Gebruikers kunnen hun tekst-naar-audio-instellingen opslaan als persoonlijke voorkeur. Zo hoeven model, taal, stem en uitspraakinstructies niet telkens opnieuw gekozen te worden.

WhatsApp