Aller au contenu principal

Modèles de synthèse vocale

AI-School prend en charge des modèles de synthèse vocale permettant de convertir du texte en audio. Ces modèles sont utilisés dans Texte vers audio sur le tableau de bord et dans les fonctions qui génèrent de l’audio à partir d’un chat.

Catalogue actuel

FournisseurModèleRemarque
OpenAIGPT-4o mini TTSVoix naturelle avec un bon contrôle du ton et du style.
GoogleGemini 3.1 Flash TTS PreviewNouveau modèle vocal Gemini avec un contrôle précis du style, du rythme et du ton.
IA européenneVoxtral Mini TTSSynthèse vocale européenne basée sur Mistral Voxtral Mini.

Claude ne dispose pas de modèle de synthèse vocale propre dans le catalogue. Si Claude est activé comme fournisseur, les modèles vocaux dépendent des autres fournisseurs configurés.

Chat vocal en temps réel

Le chat vocal utilise un modèle temps réel distinct qui combine écoute et réponse dans une conversation en direct. Pour OpenAI, AI-School utilise par défaut GPT-Realtime 2.1. Les configurations existantes avec GPT-Realtime 1.5 ou GPT-Realtime 2 sont automatiquement mises à jour vers cette version. Gemini Live reste disponible en alternative lorsque Google est configuré pour la voix en temps réel.

Formation linguistique et langue de support

Pour un assistant vocal, la langue définie détermine la langue principale parlée par l’assistant. La langue de l’interface utilisateur reste disponible comme langue de support. Un utilisateur peut ainsi, par exemple, pratiquer l’espagnol et demander brièvement une explication en néerlandais. Après l’explication, le formateur linguistique revient à l’espagnol.

Les formateurs linguistiques standards pour le néerlandais, l’anglais, l’allemand, l’espagnol et le français sont conçus pour de courtes conversations de niveau A1. Ils posent une question à la fois, adaptent le vocabulaire et le rythme, et corrigent uniquement les erreurs principales. Un assistant vocal personnalisé utilise de la même manière son propre prompt système, langue, voix, fichiers et paramètres d’outils.

Outils pendant le chat vocal

Les assistants vocaux peuvent, selon l’environnement et leurs paramètres, utiliser automatiquement des outils en lecture seule pour, par exemple, des informations Internet, le manuel, les chats précédents, la météo, Wikipédia et des ressources éducatives sélectionnées. Dans le formulaire de l’assistant, vous activez ou désactivez un outil approprié. Un outil activé est en Automatique : l’assistant décide alors lui-même quand son utilisation est utile.

Ce que détermine un modèle vocal

Un modèle vocal détermine comment le texte est prononcé et quelles fonctionnalités sont disponibles. Par exemple :

  • les voix disponibles ;
  • les langues supportées par une voix ;
  • la qualité et la naturalité de la prononciation ;
  • la manière dont les instructions sur le rythme, le ton, l’accent et la prononciation sont suivies.

Voix et langues

Les voix disponibles varient selon le fournisseur. AI-School affiche dans texte vers audio uniquement les voix testées pour la langue choisie, ou les voix désignées comme multilingues par le fournisseur. Si une voix est destinée uniquement à certaines langues, cette langue est indiquée avec la voix.

OpenAI et Google supportent la plupart des langues du catalogue. Voxtral Mini TTS peut traiter plusieurs langues, mais le catalogue actuel contient des voix testées pour l’anglais et le français. Ce modèle démarre donc par défaut avec une combinaison anglaise appropriée et n’est pas silencieusement associé à du texte néerlandais. Si aucune voix testée n’est disponible pour une langue choisie, AI-School affiche un avertissement et vous choisissez une autre langue ou un autre modèle vocal.

Une voix d’une autre langue peut provoquer un accent étranger. Une telle voix cross-linguale n’est donc jamais utilisée automatiquement comme voix par défaut ou préférence enregistrée. Les intégrations techniques peuvent demander explicitement ce fallback de qualité.

Prompt système

Dans texte vers audio, le prompt système peut être utilisé pour contrôler la prononciation et le style. AI-School remplit une instruction de base adaptée à la langue. Pour le néerlandais, cela demande des voyelles néerlandaises, l’accentuation, le rythme et l’intonation sans accent anglais. Des termes comme AI, AI-School, ChatGPT et OpenAI peuvent garder une prononciation anglaise et Claude est prononcé comme un nom français. Vous pouvez adapter l’instruction pour, par exemple, le rythme, le ton ou un public spécifique.

Qualité audio et fallback

L’audio généré par OpenAI, Google et Mistral est contrôlé et enregistré sous forme de fichier PCM16-WAV standardisé. Les métadonnées techniques contiennent notamment la fréquence d’échantillonnage, le nombre de canaux, la langue, la voix et la route de qualité. Cela permet de contrôler la qualité audio et d’éviter qu’une réponse différente du fournisseur soit enregistrée silencieusement dans un autre format audio.

Le bouton de lecture pour un texte existant peut aussi utiliser la voix système du navigateur ou de l’appareil. Cela est visible comme qualité de fallback. L’application choisit, si possible, une voix système adaptée à la langue, mais la prononciation et la disponibilité peuvent varier selon l’appareil.

Préférences

Les utilisateurs peuvent enregistrer leurs paramètres texte vers audio comme préférences personnelles. Ainsi, modèle, langue, voix et instructions de prononciation n’ont pas besoin d’être choisis à chaque fois.

WhatsApp