Modele tekst-na-mowę
AI-School obsługuje modele tekst-na-mowę, które umożliwiają konwersję tekstu na dźwięk. Modele te są używane w funkcji Tekst na audio na pulpicie oraz w funkcjach generujących dźwięk z czatu.
Aktualny katalog
| Dostawca | Model | Uwagi |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Naturalnie brzmiąca mowa z dobrą kontrolą tonu i stylu. |
| Gemini 3.1 Flash TTS Preview | Nowy model mowy Gemini z precyzyjną kontrolą stylu, tempa i tonu. | |
| Europejska AI | Voxtral Mini TTS | Europejski tekst-na-mowę oparty na Mistral Voxtral Mini. |
Claude nie posiada własnego modelu tekst-na-mowę w katalogu. Jeśli Claude jest włączony jako dostawca, modele mowy pozostają zależne od pozostałych skonfigurowanych dostawców.
Czaty głosowe w czasie rzeczywistym
Czat głosowy używa oddzielnego modelu czasu rzeczywistego, który łączy słuchanie i odpowiadanie w jednej rozmowie na żywo. Dla OpenAI AI-School domyślnie używa GPT-Realtime 2.1. Istniejące ustawienia z GPT-Realtime 1.5 lub GPT-Realtime 2 są automatycznie aktualizowane do tej wersji. Gemini Live pozostaje dostępny jako alternatywa, gdy Google jest skonfigurowany do mowy w czasie rzeczywistym.
Trening językowy i język wsparcia
W asystencie głosowym ustawiony język określa, w jakim języku asystent mówi głównie. Język interfejsu użytkownika pozostaje dostępny jako język wsparcia. Użytkownik może na przykład ćwiczyć hiszpański i krótko poprosić o wyjaśnienie po niderlandzku. Po wyjaśnieniu trener językowy wraca do hiszpańskiego.
Standardowe trenera językowe dla niderlandzkiego, angielskiego, niemieckiego, hiszpańskiego i francuskiego są przygotowane do krótkich rozmów na poziomie A1. Zadają jedno pytanie na raz, dostosowują słownictwo i tempo oraz poprawiają tylko najważniejsze błędy. Własnoręcznie stworzony asystent głosowy używa w ten sam sposób własnego promptu systemowego, języka, głosu, plików i ustawień narzędzi.
Narzędzia podczas czatu głosowego
Asystenci głosowi mogą, w zależności od środowiska i ustawień, automatycznie korzystać z narzędzi tylko do odczytu, np. informacji z internetu, instrukcji, wcześniejszych czatów, pogody, Wikipedii i wybranych źródeł edukacyjnych. W formularzu asystenta można włączyć lub wyłączyć odpowiednie narzędzie. Włączone narzędzie jest ustawione na Automatycznie: asystent sam decyduje, kiedy jego użycie jest przydatne.
Co determinuje model mowy
Model mowy określa, jak tekst jest wymawiany i jakie funkcje są dostępne. Należą do nich:
- dostępne głosy;
- języki obsługiwane przez dany głos;
- jakość i naturalność wymowy;
- sposób realizacji instrukcji dotyczących tempa, tonu, akcentu i wymowy.
Głosy i języki
Dostępne głosy różnią się w zależności od dostawcy. AI-School pokazuje przy tekście na audio tylko głosy przetestowane dla wybranego języka lub głosy oznaczone przez dostawcę jako wielojęzyczne. Jeśli głos jest przeznaczony tylko dla określonych języków, język ten jest podany przy głosie.
OpenAI i Google obsługują większość języków w katalogu. Voxtral Mini TTS może obsługiwać wiele języków, ale obecny katalog głosów zawiera przetestowane głosy dla angielskiego i francuskiego. Dlatego model ten domyślnie startuje z odpowiednią kombinacją angielską i nie jest automatycznie łączony z tekstem niderlandzkim. Jeśli dla wybranego języka nie ma dostępnego przetestowanego głosu, AI-School wyświetla ostrzeżenie i pozwala wybrać inny język lub inny model mowy.
Głos z innego języka może powodować obcy akcent. Taki głos międzyjęzykowy nigdy nie jest automatycznie używany jako domyślny lub preferowany. Połączenia techniczne mogą jednak wyraźnie zażądać tego rozwiązania jako fallback jakości.
Prompt systemowy
Przy tekście na audio prompt systemowy może być użyty do sterowania wymową i stylem. AI-School wypełnia wtedy podstawową instrukcję dopasowaną do języka. Dla niderlandzkiego prosi o niderlandzkie samogłoski, akcent, rytm i intonację bez angielskiego akcentu. Terminy takie jak AI, AI-School, ChatGPT i OpenAI mogą zachować angielską wymowę, a Claude jest wymawiane jak francuskie imię. Instrukcję można dostosować np. pod kątem tempa, tonu lub konkretnej grupy odbiorców.
Jakość dźwięku i fallback
Generowany dźwięk z OpenAI, Google i Mistral jest kontrolowany i zapisywany jako ustandaryzowany plik PCM16-WAV. Metadane techniczne zawierają m.in. częstotliwość próbkowania, liczbę kanałów, język, głos i ścieżkę jakości. Dzięki temu jakość dźwięku pozostaje kontrolowana, a nieoczekiwana odpowiedź dostawcy nie jest niezauważalnie zapisywana w innym formacie audio.
Przycisk odczytu istniejącego tekstu może również używać głosu systemowego przeglądarki lub urządzenia. Jest to widoczne jako fallback jakości. Aplikacja wybiera, jeśli to możliwe, głos systemowy pasujący do języka, ale wymowa i dostępność mogą się różnić w zależności od urządzenia.
Preferencje
Użytkownicy mogą zapisać swoje ustawienia tekst-na-audio jako preferencje osobiste. Dzięki temu nie trzeba za każdym razem wybierać modelu, języka, głosu i instrukcji wymowy.