メインコンテンツへスキップ

テキスト読み上げモデル

AI-Schoolはテキストを音声に変換するテキスト読み上げモデルをサポートしています。これらのモデルは、ダッシュボードのテキストから音声へ機能やチャットから音声を生成する機能で使用されます。

現在のカタログ

提供者モデル備考
OpenAIGPT-4o mini TTS自然な発話で、トーンやスタイルの制御が優れています。
GoogleGemini 3.1 Flash TTS Preview新しいGemini音声モデルで、スタイル、速度、トーンの精密な制御が可能です。
欧州AIVoxtral Mini TTSMistral Voxtral Miniに基づく欧州のテキスト読み上げモデル。

Claudeはカタログに独自のテキスト読み上げモデルを持っていません。Claudeが提供者として有効になっている場合、音声モデルは他に設定された提供者に依存します。

リアルタイム音声チャット

音声チャットは、聞き取りと応答を1つのライブ会話で組み合わせる専用のリアルタイムモデルを使用します。OpenAIの場合、AI-SchoolはデフォルトでGPT-Realtime 2.1を使用します。GPT-Realtime 1.5またはGPT-Realtime 2の既存設定は自動的にこのバージョンに更新されます。Googleがリアルタイム音声に設定されている場合は、代替としてGemini Liveも利用可能です。

言語トレーニングとサポート言語

音声アシスタントでは、設定された言語が主に話す言語を決定します。ユーザーのインターフェース言語はサポート言語として引き続き利用可能です。たとえば、学習者はスペイン語を練習しつつ、短時間オランダ語で説明を求めることができます。説明後、言語トレーナーは再びスペイン語に切り替わります。

オランダ語、英語、ドイツ語、スペイン語、フランス語の標準言語トレーナーは、A1レベルの短い会話向けに設計されています。1回に1つの質問をし、語彙や速度を調整し、重要な誤りのみを修正します。自作の音声アシスタントも同様に独自のシステムプロンプト、言語、声、ファイル、ツール設定を使用します。

音声チャット中のツール

音声アシスタントは環境や設定に応じて、インターネット情報、マニュアル、過去のチャット、天気、Wikipedia、選択された教育リソースなどの読み取り専用ツールを自動的に使用できます。アシスタントフォームで適切なツールをオンまたはオフに設定します。有効なツールは自動となり、アシスタントが利用の有用性を判断します。

音声モデルが決定すること

音声モデルは、テキストの発音方法や利用可能な機能を決定します。例として:

  • 利用可能な声の種類
  • 声が対応する言語
  • 発音の品質と自然さ
  • 速度、トーン、アクセント、発音に関する指示の遵守方法

声と対応言語

利用可能な声は提供者ごとに異なります。AI-Schoolはテキストから音声への変換時に、選択された言語でテスト済みの声、または提供者が多言語対応とした声のみを表示します。特定の言語専用の声には、その言語が声の横に表示されます。

OpenAIとGoogleはカタログ内のほとんどの言語をサポートしています。Voxtral Mini TTSは複数言語を処理可能ですが、現在の声カタログには英語とフランス語のテスト済み声のみが含まれています。そのため、このモデルはデフォルトで適切な英語の組み合わせで開始し、オランダ語テキストに黙って割り当てられることはありません。選択した言語にテスト済みの声がない場合、AI-Schoolは警告を表示し、別の言語または音声モデルを選択するよう促します。

異なる言語の声は外国語アクセントを生じる可能性があります。そのため、そのようなクロスリンガルな声は自動的に標準または保存された優先設定として使用されることはありません。技術的な連携でのみ明示的にこの品質フォールバックを要求できます。

システムプロンプト

テキストから音声への変換では、システムプロンプトを使って発音やスタイルを制御できます。AI-Schoolは言語に適した基本指示を自動で入力します。オランダ語の場合、英語アクセントのないオランダ語の母音、強勢、リズム、イントネーションを求めます。AIAI-SchoolChatGPTOpenAIなどの用語は英語発音のままでよく、Claudeはフランス語名として発音されます。速度、トーン、特定の対象者向けなどに合わせて指示を調整可能です。

音声品質とフォールバック

OpenAI、Google、Mistralで生成された音声は検査され、標準化されたPCM16-WAVファイルとして保存されます。技術的メタデータにはサンプル周波数、チャンネル数、言語、声、品質ルートなどが含まれます。これにより音声品質の管理が可能となり、異なる提供者の応答が別の音声フォーマットとして知らずに保存されることを防ぎます。

既存テキストの読み上げボタンは、ブラウザやデバイスのシステム音声を使用することもあります。これはフォールバック品質として表示されます。アプリケーションは可能な限り言語に合ったシステム音声を選択しますが、発音や利用可能性はデバイスによって異なる場合があります。

設定の保存

ユーザーはテキスト読み上げの設定を個人の好みとして保存できます。これにより、モデル、言語、声、発音指示を毎回選択する必要がなくなります。

WhatsApp