Gå til hovedinnhold

Tekst-til-tale-modeller

AI-School støtter tekst-til-tale-modeller som kan konvertere tekst til lyd. Disse modellene brukes i Tekst til lyd på dashbordet og i funksjoner som genererer lyd fra en chat.

Nåværende katalog

LeverandørModellMerknad
OpenAIGPT-4o mini TTSNaturlig klingende tale med god kontroll på tone og stil.
GoogleGemini 3.1 Flash TTS PreviewNytt Gemini-talemodell med presis kontroll på stil, tempo og tone.
Europeisk AIVoxtral Mini TTSEuropeisk tekst-til-tale basert på Mistral Voxtral Mini.

Claude har ikke en egen tekst-til-tale-modell i katalogen. Hvis Claude er aktivert som leverandør, forblir talemodeller avhengige av de øvrige konfigurerte leverandørene.

Realtime talechat

Talechat bruker en egen realtime-modell som kombinerer lytting og svar i én live samtale. For OpenAI bruker AI-School som standard GPT-Realtime 2.1. Eksisterende innstillinger med GPT-Realtime 1.5 eller GPT-Realtime 2 oppdateres automatisk til denne versjonen. Gemini Live forblir tilgjengelig som alternativ når Google er konfigurert for realtime tale.

Språktrening og støttespråk

I en taleassistent bestemmer det innstilte språket hvilket språk assistenten hovedsakelig snakker. Brukergrensesnittets språk forblir tilgjengelig som støttespråk. En elev kan for eksempel øve på spansk og kort be om forklaring på nederlandsk. Etter forklaringen går språktreneren tilbake til spansk.

Standard språktrenere for nederlandsk, engelsk, tysk, spansk og fransk er laget for korte samtaler på A1-nivå. De stiller ett spørsmål om gangen, tilpasser ordforråd og tempo, og retter bare de viktigste feilene. En egendefinert taleassistent bruker på samme måte sin egen systemprompt, språk, stemme, filer og verktøyinnstillinger.

Verktøy under talechat

Taleassistenter kan, avhengig av miljø og innstillinger, automatisk bruke skrivebeskyttede verktøy for for eksempel internetinformasjon, manualen, tidligere chatter, vær, Wikipedia og utvalgte undervisningsressurser. I assistentskjemaet kan du slå et passende verktøy på eller av. Et aktivert verktøy står på Automatisk: assistenten bestemmer da selv når bruk er nyttig.

Hva en talemodell bestemmer

En talemodell bestemmer hvordan tekst uttales og hvilke muligheter som er tilgjengelige. Tenk på:

  • tilgjengelige stemmer;
  • språk som en stemme støtter;
  • kvalitet og naturlighet i uttalen;
  • hvordan instruksjoner om tempo, tone, aksent og uttale følges.

Stemmer og språk

De tilgjengelige stemmene varierer per leverandør. AI-School viser ved tekst til lyd kun stemmer som er testet for valgt språk, eller stemmer som leverandøren har merket som flerspråklige. Hvis en stemme kun er ment for visse språk, står det språket oppført ved stemmen.

OpenAI og Google støtter de fleste språk i katalogen. Voxtral Mini TTS kan håndtere flere språk, men den nåværende stemmekatalogen inneholder testede stemmer for engelsk og fransk. Derfor starter denne modellen som standard med en passende engelsk kombinasjon og kobles ikke stille til nederlandsk tekst. Hvis det ikke finnes en testet stemme for valgt språk, viser AI-School en advarsel, og du må velge et annet språk eller en annen talemodell.

En stemme fra et annet språk kan gi en utenlandsk aksent. En slik kryss-språklig stemme brukes derfor aldri automatisk som standard eller lagret preferanse. Tekniske koblinger kan bare eksplisitt be om denne kvalitetsfallbacken.

Systemprompt

Ved tekst til lyd kan systemprompten brukes til å styre uttale og stil. AI-School fyller inn en språktilpasset basisinstruksjon. For nederlandsk ber den om nederlandske vokaler, trykk, rytme og intonasjon uten engelsk aksent. Begreper som AI, AI-School, ChatGPT og OpenAI kan beholde engelsk uttale, og Claude uttales som et fransk navn. Du kan tilpasse instruksjonen for for eksempel tempo, tone eller en spesifikk målgruppe.

Lydkvalitet og fallback

Generert lyd fra OpenAI, Google og Mistral kontrolleres og lagres som standardisert PCM16-WAV-fil. Den tekniske metadataen inneholder blant annet samplingsfrekvens, antall kanaler, språk, stemme og kvalitetsrute. Dette sikrer at lydkvaliteten kan kontrolleres, og at en avvikende leverandørrespons ikke lagres ubemerket som et annet lydformat.

Leseknappen ved eksisterende tekst kan også bruke systemstemmen til nettleseren eller enheten. Dette vises som fallback-kvalitet. Applikasjonen velger der det er mulig en systemstemme som passer til språket, men uttale og tilgjengelighet kan variere mellom enheter.

Preferanser

Brukere kan lagre sine tekst-til-lyd-innstillinger som personlige preferanser. Dermed trenger de ikke velge modell, språk, stemme og uttaleinstruksjoner på nytt hver gang.

WhatsApp