Kostenloses Tool · Ohne Registrierung

Kostenlos Text in Sprache umwandeln: Natürliche KI-Stimmen, MP3-Download

Zuletzt aktualisiert am Von Avalon

Wandeln Sie Text in natürlich klingende Sprache um und laden Sie sie als MP3 oder WAV herunter.

    Ihr Text verlässt Ihr Gerät nie. Die Stimme wird von einem KI-Modell erzeugt, das in Ihrem Browser läuft, daher wird nichts auf einen Server hochgeladen. Das Audio ist KI-generiert; bitte weisen Sie dort darauf hin, wo Sie es veröffentlichen.

    Was dieses Tool kann

    Um Text kostenlos in Sprache umzuwandeln, fügen Sie oben Ihren Text ein, wählen Sie eine Stimme und klicken Sie auf Sprache erstellen: Sie können das Ergebnis sofort abspielen und als MP3 herunterladen, ganz ohne Registrierung. Die Stimmen stammen von Kokoro, einem offenen KI-Sprachmodell, und laufen in Ihrem Browser, sodass Ihr Text auf Ihrem Gerät bleibt. Das eignet sich für Sprechertexte zu Kurzvideos, Vertonung von Folien, Korrekturlesen per Gehör und zum Anhören eigener Texte.

    So verwenden Sie es

    1. Geben Sie Ihren Text in das Feld ein oder fügen Sie ihn ein, oder öffnen Sie eine .txt-Datei.
    2. Wählen Sie eine Stimme und eine Geschwindigkeit.
    3. Wählen Sie MP3 für eine kleine Datei, die überall abgespielt wird, oder WAV für den Videoschnitt.
    4. Klicken Sie auf Sprache erstellen. Beim ersten Mal wird das Sprachmodell einmalig heruntergeladen.
    5. Klicken Sie auf Wiedergabe, um zuzuhören, und dann auf Herunterladen.

    Tipps für natürliche Sprache

    • Schreiben Sie Zahlen, Datumsangaben und Preise ganz normal: „$19.99“, „October 4“ und „9:30“ werden vollständig vorgelesen.
    • Zeichensetzung bestimmt den Rhythmus: Ein Komma sorgt für eine kurze Pause, ein neuer Absatz für eine längere.
    • Halten Sie die Sätze für einen Video-Sprechertext kurz und lassen Sie eine Leerzeile, wo die Szene wechselt.
    • Wenn ein Name falsch klingt, schreiben Sie ihn so, wie er ausgesprochen wird.
    • Brauchen Sie Untertitel für das fertige Video? Nutzen Sie unseren kostenlosen Untertitel-Generator.

    Danksagungen

    Die Stimmen sind Kokoro-82M von hexgrad (Apache 2.0). Für die Aussprache werden die Wörterbücher von misaki (Apache 2.0) verwendet. Das Modell läuft mit ONNX Runtime Web (MIT), und MP3-Dateien werden mit lamejs (LGPL) erstellt. Vollständige Hinweise: Lizenzen von Drittanbietern.

    Kostenlos, Pro und Pro+

    KostenlosProPro+
    Text pro Audiodatei1.000 Zeichen20.000 Zeichen20.000 Zeichen im Browser, 40.000 Zeichen mit schnellen Server-Stimmen
    Eine Audiodatei pro Absatz, als ZIP—JaJa
    Gespeicherte Voreinstellungen—JaJa
    ErgebnisqualitätGleich in Ihrem Browser bei jedem TarifGleich in Ihrem Browser, höhere Genauigkeit auf unserem Server
    Server-Tools, die mit Credits bezahlt werdenMit einem Credit-PaketMit einem Credit-Paket300 Credits pro Monat

    Pro+-Guthaben bezahlen Server-Tools: Sprache in Text mit höherer Genauigkeit, automatische Untertitel mit höherer Genauigkeit, schnelle Server-Stimmen sowie KI-PDF-Zusammenfassungen, -Antworten und -Übersetzungen. Ein Guthabenpaket (150 Guthaben, 12 Monate gültig) funktioniert mit jedem Tarif. Tarife vergleichen.

    Häufig gestellte Fragen

    Darf ich das Audio in YouTube-Videos oder für kommerzielle Zwecke verwenden?

    Ja. Das Sprachmodell Kokoro-82M wird unter der Apache-2.0-Lizenz veröffentlicht, die eine kommerzielle Nutzung erlaubt, und wir fügen den von Ihnen erstellten Audiodateien keine eigenen Bedingungen hinzu. Die Stimme ist KI-generiert: Weisen Sie darauf hin, wo Ihre Plattform eine Kennzeichnung von KI-Inhalten verlangt.

    Wird mein Text irgendwohin hochgeladen?

    Nein. Das Sprachmodell läuft in Ihrem Browser auf Ihrem eigenen Gerät. Ihr Text wird weder an unsere Server noch an Dritte gesendet. Die einzige Ausnahme sind die optionalen schnellen Server-Stimmen von Pro+, die Sie selbst aktivieren.

    Warum dauert der erste Durchgang länger?

    Beim ersten Mal lädt Ihr Browser das Sprachmodell und sein Aussprachewörterbuch herunter, etwa 97 MB. Beides wird in Ihrem Browser gespeichert, sodass spätere Besuche sofort starten.

    Wie lange dauert es?

    Das hängt von Ihrem Gerät ab. Auf einem aktuellen Laptop ist das Audio meist schneller erstellt, als es abgespielt wird; Smartphones und ältere Computer sind langsamer. Der Fortschrittsbalken zeigt, wie weit der Vorgang ist, und Sie können jederzeit abbrechen.

    Welche Sprachen werden unterstützt?

    Englisch, mit amerikanischen Stimmen. Andere Sprachen werden noch nicht unterstützt.

    Warum klingt ein Wort falsch?

    Die Aussprache stammt aus einem Wörterbuch mit etwa 180.000 englischen Wörtern. Namen und neue Wörter, die darin fehlen, werden nach Schreibregeln gelesen, was danebengehen kann. Meist hilft es, das Wort so zu schreiben, wie es klingt, zum Beispiel Shiv-awn für Siobhan.

    Welche Grenzen gibt es?

    Die kostenlose Version vertont bis zu 1.000 Zeichen auf einmal, ohne Tageslimit. Avalon Pro vertont bis zu 20.000 Zeichen auf einmal, kann pro Absatz eine Audiodatei in einer ZIP-Datei speichern und behält Ihre Stimme und Geschwindigkeit als gespeicherte Voreinstellungen. Avalon Pro+ bietet zusätzlich schnelle Server-Stimmen für Texte bis zu 40.000 Zeichen, bezahlt mit Credits.

    Jedes neue Experiment per E-Mail erhalten

    Eine kurze E-Mail am Ende jedes Monats: die durchgeführten Experimente, die Zahlen und die Schritte zum Nachmachen. Jederzeit abbestellbar.