मुफ़्त टूल · बिना साइन-अप

मुफ़्त टेक्स्ट से स्पीच: स्वाभाविक AI आवाज़ें, MP3 डाउनलोड

आख़िरी अपडेट Avalon की ओर से

टेक्स्ट को प्राकृतिक आवाज़ वाली स्पीच में बदलें और उसे MP3 या WAV के रूप में डाउनलोड करें।

    आपका टेक्स्ट कभी आपके डिवाइस से बाहर नहीं जाता। आवाज़ आपके ब्राउज़र में चलने वाले AI मॉडल से बनती है, इसलिए सर्वर पर कुछ भी अपलोड नहीं होता। ऑडियो AI से बना है; इसे जहाँ भी प्रकाशित करें, कृपया यह बताएँ।

    यह टूल क्या करता है

    टेक्स्ट को मुफ़्त में स्पीच में बदलने के लिए, ऊपर अपना टेक्स्ट पेस्ट करें, कोई आवाज़ चुनें और स्पीच बनाएँ दबाएँ: आप नतीजा तुरंत चला सकते हैं और MP3 के रूप में डाउनलोड कर सकते हैं, साइन-अप की ज़रूरत नहीं। आवाज़ें Kokoro से आती हैं, जो एक ओपन AI वॉइस मॉडल है, और आपके ब्राउज़र में चलती हैं, इसलिए आपका टेक्स्ट आपके डिवाइस पर ही रहता है। यह छोटे वीडियो के वॉइस-ओवर, स्लाइड के नैरेशन, सुनकर प्रूफ़रीडिंग करने और अपनी लिखी चीज़ें सुनने के लिए अच्छा है।

    इसका इस्तेमाल कैसे करें

    1. टेक्स्ट को बॉक्स में टाइप या पेस्ट करें, या कोई .txt फ़ाइल खोलें।
    2. एक आवाज़ और एक स्पीड चुनें।
    3. हर जगह चलने वाली छोटी फ़ाइल के लिए MP3 चुनें, या वीडियो एडिटिंग के लिए WAV चुनें।
    4. स्पीच बनाएँ दबाएँ। पहली बार वॉइस मॉडल एक बार डाउनलोड होता है।
    5. सुनने के लिए चलाएँ दबाएँ, फिर डाउनलोड करें।

    प्राकृतिक आवाज़ के लिए सुझाव

    • नंबर, तारीखें और कीमतें सामान्य तरीके से लिखें: "$19.99", "4 अक्टूबर" और "9:30" पूरे पढ़े जाते हैं।
    • विराम चिह्न लय तय करते हैं: कॉमा छोटा विराम देता है और नया पैराग्राफ़ लंबा विराम देता है।
    • वीडियो वॉइस-ओवर के लिए वाक्य छोटे रखें और जहाँ दृश्य बदलता है वहाँ एक खाली लाइन छोड़ें।
    • अगर कोई नाम गलत सुनाई दे, तो उसे वैसे लिखें जैसे बोला जाता है।
    • तैयार वीडियो के लिए कैप्शन चाहिए? हमारा मुफ़्त सबटाइटल मेकर इस्तेमाल करें।

    क्रेडिट्स

    आवाज़ें hexgrad की Kokoro-82M हैं (Apache 2.0)। उच्चारण के लिए misaki की डिक्शनरी इस्तेमाल होती है (Apache 2.0)। मॉडल ONNX Runtime Web (MIT) से चलता है, और MP3 फ़ाइलें lamejs (LGPL) से लिखी जाती हैं। पूरी जानकारी: थर्ड-पार्टी लाइसेंस।

    मुफ़्त, Pro और Pro+

    मुफ़्तProPro+
    हर ऑडियो फ़ाइल के लिए टेक्स्ट1,000 अक्षर20,000 अक्षरब्राउज़र में 20,000 अक्षर, तेज़ सर्वर आवाज़ों के साथ 40,000 अक्षर
    हर पैराग्राफ़ के लिए एक ऑडियो फ़ाइल, ZIP में—हांहां
    सेव किए गए प्रीसेट—हांहां
    नतीजे की क्वालिटीहर प्लान पर आपके ब्राउज़र में एक जैसाआपके ब्राउज़र में एक जैसा, हमारे सर्वर पर ज़्यादा सटीकता
    क्रेडिट से चलने वाले सर्वर टूलक्रेडिट पैक के साथक्रेडिट पैक के साथहर महीने 300 क्रेडिट

    Pro+ क्रेडिट सर्वर टूल्स के लिए हैं: ज़्यादा सटीक स्पीच से टेक्स्ट, ज़्यादा सटीक ऑटो सबटाइटल, तेज़ सर्वर आवाज़ें और AI PDF के सारांश, जवाब और अनुवाद। क्रेडिट पैक (150 क्रेडिट, 12 महीने तक मान्य) किसी भी प्लान पर काम करता है। प्लान की तुलना करें।

    अक्सर पूछे जाने वाले सवाल

    क्या मैं ऑडियो को YouTube वीडियो में या व्यावसायिक काम के लिए इस्तेमाल कर सकता हूँ?

    हाँ। वॉइस मॉडल Kokoro-82M, Apache 2.0 लाइसेंस के तहत जारी किया गया है, जो कमर्शियल इस्तेमाल की अनुमति देता है, और आपके बनाए ऑडियो पर हम अपनी कोई शर्त नहीं जोड़ते। आवाज़ AI से बनी है: जहाँ आपका प्लेटफ़ॉर्म AI कंटेंट को लेबल करने को कहे, वहाँ यह बताएँ।

    क्या मेरा टेक्स्ट कहीं अपलोड होता है?

    नहीं। वॉइस मॉडल आपके ब्राउज़र के अंदर, आपके अपने डिवाइस पर चलता है। आपका टेक्स्ट हमारे सर्वर या किसी और को नहीं भेजा जाता। एकमात्र अपवाद वैकल्पिक Pro+ तेज़ सर्वर आवाज़ें हैं, जिन्हें आप खुद चालू करते हैं।

    पहली बार में ज़्यादा समय क्यों लगता है?

    पहली बार आपका ब्राउज़र वॉइस मॉडल और उसकी उच्चारण डिक्शनरी डाउनलोड करता है, लगभग 97 MB। ये आपके ब्राउज़र में रखे रहते हैं, इसलिए बाद की विज़िट तुरंत शुरू हो जाती हैं।

    इसमें कितना समय लगता है?

    यह आपके डिवाइस पर निर्भर करता है। नए लैपटॉप पर ऑडियो आमतौर पर चलने की गति से तेज़ बनता है; फ़ोन और पुराने कंप्यूटर धीमे होते हैं। प्रोग्रेस बार दिखाता है कि काम कितना हो चुका है, और आप कभी भी रोक सकते हैं।

    यह कौन-सी भाषाएँ बोलता है?

    अंग्रेज़ी, अमेरिकी आवाज़ों के साथ। दूसरी भाषाएँ अभी समर्थित नहीं हैं।

    कोई शब्द गलत क्यों सुनाई देता है?

    उच्चारण लगभग 180,000 अंग्रेज़ी शब्दों की डिक्शनरी से लिए जाते हैं। जो नाम और नए शब्द उसमें नहीं हैं, उन्हें वर्तनी के नियमों से पढ़ा जाता है, जिनसे गलत उच्चारण हो सकता है। शब्द को वैसे लिखना जैसा वह सुनाई देता है, जैसे Siobhan के लिए Shiv-awn, आमतौर पर इसे ठीक कर देता है।

    सीमाएँ क्या हैं?

    मुफ़्त वर्शन एक बार में 1,000 अक्षरों तक की आवाज़ बनाता है, रोज़ की कोई सीमा नहीं। Avalon Pro एक बार में 20,000 अक्षरों तक की आवाज़ बनाता है, हर पैराग्राफ़ के लिए एक ऑडियो फ़ाइल ZIP में सेव कर सकता है, और आपकी आवाज़ और स्पीड को सेव किए गए प्रीसेट के रूप में रखता है। Avalon Pro+ 40,000 अक्षरों तक के टेक्स्ट के लिए तेज़ सर्वर आवाज़ें जोड़ता है, जिनका भुगतान क्रेडिट से होता है।

    हर नया प्रयोग ईमेल से पाएँ

    हर महीने के अंत में एक छोटा ईमेल: हमने कौन-से प्रयोग किए, नंबर, और वे स्टेप जिन्हें आप दोहरा सकते हैं। कभी भी अनसब्सक्राइब करें।