मुख्य सामग्री पर जाएं

टेक्स्ट-से-स्पीच मॉडल

AI-School टेक्स्ट-से-स्पीच मॉडल का समर्थन करता है जो टेक्स्ट को ऑडियो में परिवर्तित कर सकते हैं। ये मॉडल डैशबोर्ड पर टेक्स्ट से ऑडियो और चैट से ऑडियो उत्पन्न करने वाले फ़ंक्शंस में उपयोग किए जाते हैं।

वर्तमान सूची

प्रदातामॉडलटिप्पणी
OpenAIGPT-4o mini TTSस्वाभाविक सुनाई देने वाली आवाज़ जिसमें टोन और शैली पर अच्छी नियंत्रण होती है।
GoogleGemini 3.1 Flash TTS Previewनया Gemini स्पीच मॉडल जो शैली, गति और टोन पर सटीक नियंत्रण प्रदान करता है।
यूरोपीय AIVoxtral Mini TTSMistral Voxtral Mini पर आधारित यूरोपीय टेक्स्ट-टू-स्पीच।

Claude के पास सूची में अपना कोई टेक्स्ट-से-स्पीच मॉडल नहीं है। यदि Claude प्रदाता के रूप में सक्षम है, तो स्पीच मॉडल अन्य कॉन्फ़िगर किए गए प्रदाताओं पर निर्भर रहेंगे।

रियलटाइम स्पीच चैट

स्पीच चैट एक अलग रियलटाइम मॉडल का उपयोग करता है जो एक लाइव बातचीत में सुनना और जवाब देना दोनों को संयोजित करता है। OpenAI के लिए AI-School डिफ़ॉल्ट रूप से GPT-Realtime 2.1 का उपयोग करता है। GPT-Realtime 1.5 या GPT-Realtime 2 वाले मौजूदा सेटिंग्स स्वचालित रूप से इस संस्करण में अपडेट हो जाते हैं। Google के लिए रियलटाइम स्पीच कॉन्फ़िगर होने पर Gemini Live वैकल्पिक रूप में उपलब्ध रहता है।

भाषा प्रशिक्षण और समर्थन भाषा

एक स्पीच असिस्टेंट में सेट की गई भाषा यह निर्धारित करती है कि असिस्टेंट मुख्य रूप से किस भाषा में बोलता है। उपयोगकर्ता की इंटरफ़ेस भाषा समर्थन भाषा के रूप में भी उपलब्ध रहती है। इसलिए एक छात्र उदाहरण के लिए स्पेनिश का अभ्यास कर सकता है और संक्षेप में डच में स्पष्टीकरण मांग सकता है। स्पष्टीकरण के बाद भाषा प्रशिक्षक फिर से स्पेनिश पर स्विच कर देता है।

डच, अंग्रेज़ी, जर्मन, स्पेनिश और फ्रेंच के लिए डिफ़ॉल्ट भाषा प्रशिक्षक A1 स्तर की छोटी बातचीत के लिए डिज़ाइन किए गए हैं। वे एक बार में एक प्रश्न पूछते हैं, शब्दावली और गति को समायोजित करते हैं और केवल मुख्य त्रुटियों को सुधारते हैं। एक स्वयं निर्मित स्पीच असिस्टेंट इसी तरह अपनी स्वयं की सिस्टम प्रॉम्प्ट, भाषा, आवाज़, फ़ाइलें और टूल सेटिंग्स का उपयोग करता है।

स्पीच चैट के दौरान टूल्स

स्पीच असिस्टेंट, उनके पर्यावरण और सेटिंग्स के आधार पर, स्वचालित रूप से केवल-पढ़ने वाले टूल्स का उपयोग कर सकते हैं जैसे इंटरनेट जानकारी, मैनुअल, पिछली चैट्स, मौसम, विकिपीडिया और चयनित शैक्षिक स्रोत। असिस्टेंट फॉर्म में आप उपयुक्त टूल को चालू या बंद कर सकते हैं। सक्षम टूल स्वचालित पर होता है: असिस्टेंट तब निर्णय लेता है कि उपयोग कब उपयोगी है।

एक स्पीच मॉडल क्या निर्धारित करता है

एक स्पीच मॉडल यह निर्धारित करता है कि टेक्स्ट कैसे उच्चारित किया जाता है और कौन-कौन से विकल्प उपलब्ध हैं। उदाहरण के लिए:

  • उपलब्ध आवाज़ें;
  • एक आवाज़ किन भाषाओं का समर्थन करती है;
  • उच्चारण की गुणवत्ता और स्वाभाविकता;
  • गति, टोन, उच्चारण और लहजे के निर्देशों का पालन करने का तरीका।

आवाज़ें और भाषाएँ

उपलब्ध आवाज़ें प्रदाता के अनुसार भिन्न होती हैं। AI-School टेक्स्ट से ऑडियो में केवल उन आवाज़ों को दिखाता है जो चुनी गई भाषा के लिए परीक्षण की गई हैं, या जो प्रदाता द्वारा बहुभाषी के रूप में चिह्नित हैं। यदि कोई आवाज़ केवल कुछ भाषाओं के लिए है, तो वह भाषा आवाज़ के साथ सूचीबद्ध होती है।

OpenAI और Google सूची में अधिकांश भाषाओं का समर्थन करते हैं। Voxtral Mini TTS कई भाषाओं को संभाल सकता है, लेकिन वर्तमान आवाज़ सूची में अंग्रेज़ी और फ्रेंच के लिए परीक्षण की गई आवाज़ें शामिल हैं। इसलिए यह मॉडल डिफ़ॉल्ट रूप से एक उपयुक्त अंग्रेज़ी संयोजन के साथ शुरू होता है और डच टेक्स्ट के लिए चुपचाप लिंक नहीं किया जाता। यदि चुनी गई भाषा के लिए कोई परीक्षण की गई आवाज़ उपलब्ध नहीं है, तो AI-School एक चेतावनी दिखाता है और आप किसी अन्य भाषा या स्पीच मॉडल का चयन कर सकते हैं।

किसी अन्य भाषा की आवाज़ विदेशी लहजा उत्पन्न कर सकती है। इसलिए ऐसी क्रॉस-लिंगुअल आवाज़ को कभी भी डिफ़ॉल्ट या सहेजे गए प्राथमिकता के रूप में स्वचालित रूप से उपयोग नहीं किया जाता। तकनीकी कनेक्शन केवल स्पष्ट रूप से इस गुणवत्ता फॉलबैक का अनुरोध कर सकते हैं।

सिस्टम प्रॉम्प्ट

टेक्स्ट से ऑडियो में सिस्टम प्रॉम्प्ट का उपयोग उच्चारण और शैली को नियंत्रित करने के लिए किया जा सकता है। AI-School इसके लिए भाषा-उपयुक्त मूल निर्देश भरता है। डच के लिए यह डच स्वर, ज़ोर, लय और स्वर के बिना अंग्रेज़ी लहजे के लिए कहता है। जैसे शब्द AI, AI-School, ChatGPT और OpenAI अंग्रेज़ी उच्चारण रख सकते हैं और Claude को फ्रेंच नाम के रूप में उच्चारित किया जाता है। आप निर्देश को गति, टोन या किसी विशिष्ट लक्षित समूह के लिए समायोजित कर सकते हैं।

ऑडियो गुणवत्ता और फॉलबैक

OpenAI, Google और Mistral द्वारा उत्पन्न ऑडियो की जांच की जाती है और इसे मानकीकृत PCM16-WAV फ़ाइल के रूप में सहेजा जाता है। तकनीकी मेटाडेटा में सैंपल दर, चैनल की संख्या, भाषा, आवाज़ और गुणवत्ता मार्ग शामिल हैं। इससे ऑडियो गुणवत्ता नियंत्रित रहती है और एक असामान्य प्रदाता प्रतिक्रिया को बिना पता चले किसी अन्य ऑडियो फ़ॉर्मेट के रूप में सहेजा नहीं जाता।

मौजूदा टेक्स्ट के लिए पढ़ने का बटन ब्राउज़र या डिवाइस की सिस्टम आवाज़ का भी उपयोग कर सकता है। यह फॉलबैक गुणवत्ता के रूप में दिखाई देता है। एप्लिकेशन जहां संभव हो भाषा के अनुरूप सिस्टम आवाज़ चुनता है, लेकिन उच्चारण और उपलब्धता डिवाइस के अनुसार भिन्न हो सकते हैं।

प्राथमिकताएँ

उपयोगकर्ता अपनी टेक्स्ट-से-ऑडियो सेटिंग्स को व्यक्तिगत प्राथमिकता के रूप में सहेज सकते हैं। इससे मॉडल, भाषा, आवाज़ और उच्चारण निर्देश बार-बार चुनने की आवश्यकता नहीं होती।

WhatsApp