Text-zu-Sprache-Modelle
AI-School unterstützt Text-zu-Sprache-Modelle, mit denen Text in Audio umgewandelt werden kann. Diese Modelle werden bei Text zu Audio im Dashboard und bei Funktionen verwendet, die Audio aus einem Chat generieren.
Aktueller Katalog
| Anbieter | Modell | Anmerkung |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Natürlich klingende Sprache mit guter Steuerung von Ton und Stil. |
| Gemini 3.1 Flash TTS Preview | Neues Gemini-Sprachmodell mit präziser Steuerung von Stil, Tempo und Ton. | |
| Europäische KI | Voxtral Mini TTS | Europäische Text-zu-Sprache basierend auf Mistral Voxtral Mini. |
Claude hat kein eigenes Text-zu-Sprache-Modell im Katalog. Wenn Claude als Anbieter aktiviert ist, bleiben die Sprachmodelle von den anderen konfigurierten Anbietern abhängig.
Echtzeit-Sprachchat
Der Sprachchat verwendet ein separates Echtzeitmodell, das Zuhören und Antworten in einem Live-Gespräch kombiniert. Für OpenAI verwendet AI-School standardmäßig GPT-Realtime 2.1. Bestehende Einstellungen mit GPT-Realtime 1.5 oder GPT-Realtime 2 werden automatisch auf diese Version aktualisiert. Gemini Live bleibt als Alternative verfügbar, wenn Google für Echtzeit-Sprachfunktionen konfiguriert ist.
Sprachtraining und unterstützte Sprache
Bei einem Sprachassistenten bestimmt die eingestellte Sprache, in welcher Sprache der Assistent hauptsächlich spricht. Die Benutzerschnittstellensprache bleibt zusätzlich als Unterstützungssprache verfügbar. Ein Lernender kann dadurch beispielsweise Spanisch üben und kurz um eine Erklärung auf Niederländisch bitten. Nach der Erklärung wechselt der Sprachtrainer wieder zurück zu Spanisch.
Die Standard-Sprachtrainer für Niederländisch, Englisch, Deutsch, Spanisch und Französisch sind für kurze Gespräche auf A1-Niveau eingerichtet. Sie stellen jeweils eine Frage, passen Wortschatz und Tempo an und korrigieren nur die wichtigsten Fehler. Ein selbst erstellter Sprachassistent verwendet auf dieselbe Weise seine eigene System-Prompt, Sprache, Stimme, Dateien und Tool-Einstellungen.
Tools während des Sprachchats
Sprachassistenten können, abhängig von der Umgebung und ihren Einstellungen, automatisch Nur-Lese-Tools verwenden, z. B. für Internetinformationen, das Handbuch, frühere Chats, Wetter, Wikipedia und ausgewählte Bildungsressourcen. Im Assistentenformular kannst du ein geeignetes Tool ein- oder ausschalten. Ein aktiviertes Tool steht auf Automatisch: der Assistent entscheidet dann selbst, wann die Nutzung sinnvoll ist.
Was ein Sprachmodell bestimmt
Ein Sprachmodell bestimmt, wie Text ausgesprochen wird und welche Möglichkeiten verfügbar sind. Zum Beispiel:
- die verfügbaren Stimmen;
- die Sprachen, die eine Stimme unterstützt;
- die Qualität und Natürlichkeit der Aussprache;
- die Art und Weise, wie Anweisungen zu Tempo, Ton, Akzent und Aussprache befolgt werden.
Stimmen und Sprachen
Die verfügbaren Stimmen unterscheiden sich je nach Anbieter. AI-School zeigt bei Text zu Audio nur Stimmen an, die für die gewählte Sprache getestet wurden oder vom Anbieter als mehrsprachig gekennzeichnet sind. Wenn eine Stimme nur für bestimmte Sprachen gedacht ist, wird diese Sprache bei der Stimme angegeben.
OpenAI und Google unterstützen die meisten Sprachen im Katalog. Voxtral Mini TTS kann mehrere Sprachen verarbeiten, aber der aktuelle Stimmkatalog enthält getestete Stimmen für Englisch und Französisch. Deshalb startet dieses Modell standardmäßig mit einer passenden englischen Kombination und wird nicht stillschweigend mit niederländischem Text gekoppelt. Wenn für eine gewählte Sprache keine getestete Stimme verfügbar ist, zeigt AI-School eine Warnung an und du kannst eine andere Sprache oder ein anderes Sprachmodell wählen.
Eine Stimme aus einer anderen Sprache kann einen ausländischen Akzent verursachen. Eine solche cross-linguale Stimme wird daher niemals automatisch als Standard oder gespeicherte Präferenz verwendet. Technische Verknüpfungen können diesen Qualitäts-Fallback nur explizit anfordern.
System-Prompt
Bei Text zu Audio kann die System-Prompt verwendet werden, um Aussprache und Stil zu steuern. AI-School füllt dafür eine sprachangepasste Basisanweisung aus. Für Niederländisch wird um niederländische Vokale, Betonung, Rhythmus und Intonation ohne englischen Akzent gebeten. Begriffe wie AI, AI-School, ChatGPT und OpenAI dürfen eine englische Aussprache behalten und Claude wird als französischer Name ausgesprochen. Du kannst die Anweisung anpassen, z. B. für Tempo, Ton oder eine bestimmte Zielgruppe.
Audioqualität und Fallback
Generierte Audiodateien von OpenAI, Google und Mistral werden geprüft und als standardisierte PCM16-WAV-Datei gespeichert. Die technische Metadaten enthalten unter anderem Abtastrate, Anzahl der Kanäle, Sprache, Stimme und Qualitätsroute. Dadurch bleibt die Audioqualität kontrollierbar und eine abweichende Provider-Antwort wird nicht unbemerkt als anderes Audioformat gespeichert.
Die Vorlesefunktion bei vorhandenem Text kann auch die Systemstimme des Browsers oder Geräts verwenden. Dies ist als Fallback-Qualität sichtbar. Die Anwendung wählt, wenn möglich, eine Systemstimme, die zur Sprache passt, aber Aussprache und Verfügbarkeit können je nach Gerät variieren.
Präferenzen
Benutzer können ihre Text-zu-Audio-Einstellungen als persönliche Präferenz speichern. So müssen Modell, Sprache, Stimme und Ausspracheanweisungen nicht jedes Mal neu ausgewählt werden.