Gå till huvudinnehållet

Text-till-tal-modeller

AI-School stöder text-till-tal-modeller som kan omvandla text till ljud. Dessa modeller används i Text till ljud på instrumentpanelen och i funktioner som genererar ljud från en chatt.

Nuvarande katalog

LeverantörModellKommentar
OpenAIGPT-4o mini TTSNaturligt klingande tal med bra styrning av ton och stil.
GoogleGemini 3.1 Flash TTS PreviewNytt Gemini-talmodell med exakt styrning av stil, tempo och ton.
Europeisk AIVoxtral Mini TTSEuropeisk text-till-tal baserad på Mistral Voxtral Mini.

Claude har ingen egen text-till-tal-modell i katalogen. Om Claude är aktiverad som leverantör, förblir talmodeller beroende av de övriga konfigurerade leverantörerna.

Realtids röstchatt

Röstchatt använder en separat realtidsmodell som kombinerar lyssnande och svar i ett live-samtal. För OpenAI använder AI-School som standard GPT-Realtime 2.1. Befintliga inställningar med GPT-Realtime 1.5 eller GPT-Realtime 2 uppdateras automatiskt till denna version. Gemini Live finns kvar som alternativ när Google är konfigurerat för realtidsröst.

Språkträning och stödspråk

I en röstassistent bestämmer det inställda språket vilket språk assistenten huvudsakligen talar. Användargränssnittets språk finns dessutom tillgängligt som stödspråk. En användare kan till exempel öva spanska och kort be om förklaring på nederländska. Efter förklaringen återgår språktränaren till spanska.

Standard språktränare för nederländska, engelska, tyska, spanska och franska är utformade för korta samtal på A1-nivå. De ställer en fråga i taget, anpassar ordförråd och tempo och rättar endast de viktigaste felen. En egenbyggd röstassistent använder på samma sätt sin egen systemprompt, språk, röst, filer och verktygsinställningar.

Verktyg under röstchatt

Röstassistenter kan, beroende på miljö och inställningar, automatiskt använda skrivskyddade verktyg för exempelvis internetinformation, manualen, tidigare chattar, väder, Wikipedia och utvalda utbildningsresurser. I assistentformuläret kan du slå på eller av ett lämpligt verktyg. Ett aktiverat verktyg står på Automatiskt: assistenten bestämmer då själv när användning är lämplig.

Vad en röstmodell bestämmer

En röstmodell bestämmer hur text uttalas och vilka möjligheter som finns. Tänk på:

  • tillgängliga röster;
  • språk som en röst stöder;
  • kvalitet och naturlighet i uttalet;
  • hur instruktioner om tempo, ton, accent och uttal följs.

Röster och språk

De tillgängliga rösterna skiljer sig per leverantör. AI-School visar vid text till ljud endast röster som testats för det valda språket, eller röster som leverantören har markerat som flerspråkiga. Om en röst endast är avsedd för vissa språk, anges det språket vid rösten.

OpenAI och Google stöder de flesta språk i katalogen. Voxtral Mini TTS kan hantera flera språk, men den nuvarande röstkatalogen innehåller testade röster för engelska och franska. Därför startar denna modell som standard med en passande engelsk kombination och kopplas inte tyst till nederländsk text. Om det inte finns någon testad röst för ett valt språk visar AI-School en varning och du kan välja ett annat språk eller en annan röstmodell.

En röst från ett annat språk kan ge en utländsk accent. En sådan korsspråkig röst används därför aldrig automatiskt som standard eller sparad preferens. Tekniska kopplingar kan endast uttryckligen begära denna kvalitetsfallback.

Systemprompt

Vid text till ljud kan systemprompten användas för att styra uttal och stil. AI-School fyller i en språkpassande grundinstruktion. För nederländska efterfrågas nederländska vokaler, betoning, rytm och intonation utan engelsk accent. Termer som AI, AI-School, ChatGPT och OpenAI får behålla engelsk uttal och Claude uttalas som ett franskt namn. Du kan anpassa instruktionen för exempelvis tempo, ton eller en specifik målgrupp.

Ljudkvalitet och fallback

Genererat ljud från OpenAI, Google och Mistral kontrolleras och sparas som standardiserad PCM16-WAV-fil. Den tekniska metadata innehåller bland annat samplingsfrekvens, antal kanaler, språk, röst och kvalitetsväg. Detta gör att ljudkvaliteten kan kontrolleras och att en avvikande leverantörsrespons inte sparas tyst som ett annat ljudformat.

Uppläsningsknappen vid befintlig text kan också använda systemrösten i webbläsaren eller enheten. Detta syns som fallbackkvalitet. Applikationen väljer där det är möjligt en systemröst som passar språket, men uttal och tillgänglighet kan variera per enhet.

Preferenser

Användare kan spara sina text-till-ljud-inställningar som personliga preferenser. Då behöver modell, språk, röst och uttalsinstruktioner inte väljas om varje gång.

WhatsApp