Ana içeriğe atla

Metin-konuşma modelleri

AI-School, metni sese dönüştürebilen metin-konuşma modellerini destekler. Bu modeller, kontrol panelindeki Metinden sese özelliğinde ve bir sohbetten ses üreten işlevlerde kullanılır.

Mevcut katalog

SağlayıcıModelAçıklama
OpenAIGPT-4o mini TTSTon ve stil üzerinde iyi kontrol ile doğal seslendirme.
GoogleGemini 3.1 Flash TTS ÖnizlemeStil, tempo ve ton üzerinde hassas kontrol sağlayan yeni Gemini ses modeli.
Avrupa AIVoxtral Mini TTSMistral Voxtral Mini tabanlı Avrupa metin-konuşma modeli.

Claude'un katalogda kendi metin-konuşma modeli yoktur. Claude sağlayıcı olarak etkinleştirildiğinde, ses modelleri diğer yapılandırılmış sağlayıcılara bağlı kalır.

Gerçek zamanlı sesli sohbet

Sesli sohbet, dinleme ve yanıt vermeyi tek bir canlı konuşmada birleştiren ayrı bir gerçek zamanlı model kullanır. OpenAI için AI-School varsayılan olarak GPT-Realtime 2.1 kullanır. GPT-Realtime 1.5 veya GPT-Realtime 2 ile mevcut ayarlar otomatik olarak bu sürüme güncellenir. Google gerçek zamanlı ses için yapılandırıldığında Gemini Live alternatif olarak kullanılmaya devam eder.

Dil eğitimi ve destek dili

Bir sesli asistanda ayarlanan dil, asistanın ağırlıklı olarak hangi dilde konuşacağını belirler. Kullanıcının arayüz dili ise destek dili olarak kullanılmaya devam eder. Böylece bir öğrenci örneğin İspanyolca pratik yapabilir ve kısa süreli Hollanda dili açıklaması isteyebilir. Açıklamadan sonra dil eğitmeni tekrar İspanyolcaya döner.

Hollandaca, İngilizce, Almanca, İspanyolca ve Fransızca için varsayılan dil eğitmenleri A1 seviyesinde kısa konuşmalar için tasarlanmıştır. Her seferinde bir soru sorar, kelime dağarcığını ve tempoyu ayarlar ve sadece önemli hataları düzeltir. Kendi oluşturduğunuz bir sesli asistan da aynı şekilde kendi sistem istemini, dilini, sesini, dosyalarını ve araç ayarlarını kullanır.

Sesli sohbet sırasında araçlar

Sesli asistanlar, ortam ve ayarlarına bağlı olarak, internet bilgisi, kullanım kılavuzu, önceki sohbetler, hava durumu, Wikipedia ve seçilmiş eğitim kaynakları gibi yalnızca-okuma araçlarını otomatik olarak kullanabilir. Asistan formunda uygun bir aracı açıp kapatabilirsiniz. Etkinleştirilen araç Otomatik konumundadır: asistan ne zaman kullanmanın faydalı olduğuna kendisi karar verir.

Bir ses modelinin belirledikleri

Bir ses modeli, metnin nasıl telaffuz edileceğini ve hangi özelliklerin kullanılabilir olduğunu belirler. Örneğin:

  • mevcut sesler;
  • bir sesin desteklediği diller;
  • telaffuzun kalitesi ve doğallığı;
  • tempo, ton, aksan ve telaffuz talimatlarının nasıl uygulandığı.

Sesler ve diller

Mevcut sesler sağlayıcıya göre değişir. AI-School, metinden sese yalnızca seçilen dil için test edilmiş sesleri veya sağlayıcı tarafından çok dilli olarak işaretlenmiş sesleri gösterir. Bir ses yalnızca belirli diller için tasarlanmışsa, o dil sesin yanında belirtilir.

OpenAI ve Google katalogdaki çoğu dili destekler. Voxtral Mini TTS birden fazla dili işleyebilir, ancak mevcut ses kataloğu İngilizce ve Fransızca için test edilmiş sesler içerir. Bu nedenle model varsayılan olarak uygun bir İngilizce kombinasyonla başlar ve Hollanda diline sessizce bağlanmaz. Seçilen dil için test edilmiş bir ses yoksa, AI-School bir uyarı gösterir ve başka bir dil veya ses modeli seçmenizi ister.

Başka bir dilden bir ses, yabancı aksan oluşturabilir. Böyle bir çapraz-dil sesi asla otomatik olarak varsayılan veya kaydedilmiş tercih olarak kullanılmaz. Teknik bağlantılar bu kalite geri dönüşünü yalnızca açıkça talep edebilir.

Sistem istemi

Metinden sese özelliğinde sistem istemi, telaffuz ve stili yönlendirmek için kullanılabilir. AI-School bunun için dil uyumlu temel bir talimat doldurur. Hollandaca için bu, İngiliz aksanı olmadan Hollandaca ünlüler, vurgu, ritim ve intonasyon ister. AI, AI-School, ChatGPT ve OpenAI gibi terimler İngilizce telaffuzda kalabilir ve Claude Fransızca isim olarak telaffuz edilir. Talimatı tempo, ton veya belirli bir hedef kitle için değiştirebilirsiniz.

Ses kalitesi ve geri dönüş

OpenAI, Google ve Mistral tarafından oluşturulan sesler kontrol edilir ve standartlaştırılmış PCM16-WAV dosyası olarak kaydedilir. Teknik meta veriler örnekleme frekansı, kanal sayısı, dil, ses ve kalite yolu gibi bilgileri içerir. Böylece ses kalitesi kontrol edilebilir kalır ve farklı bir sağlayıcı yanıtı fark edilmeden başka bir ses formatı olarak kaydedilmez.

Mevcut metindeki okuma düğmesi ayrıca tarayıcı veya cihazın sistem sesini kullanabilir. Bu, geri dönüş kalitesi olarak görünür. Uygulama mümkün olduğunda dile uygun bir sistem sesi seçer, ancak telaffuz ve kullanılabilirlik cihazdan cihaza değişebilir.

Tercihler

Kullanıcılar metin-konuşma ayarlarını kişisel tercih olarak kaydedebilir. Böylece model, dil, ses ve telaffuz talimatlarını her seferinde yeniden seçmek zorunda kalmazlar.

WhatsApp