Outil gratuit · Sans inscription

Synthèse vocale gratuite : voix IA naturelles, téléchargement MP3

Dernière mise à jour : Par Avalon

Transformez du texte en voix naturelle et téléchargez-la en MP3 ou WAV.

    Votre texte ne quitte jamais votre appareil. La voix est générée par un modèle d'IA qui s'exécute dans votre navigateur : rien n'est envoyé vers un serveur. L'audio est généré par IA ; merci de le mentionner là où vous le publiez.

    À quoi sert cet outil

    Pour convertir gratuitement du texte en voix, collez votre texte ci-dessus, choisissez une voix et cliquez sur Créer la voix : vous pouvez écouter le résultat tout de suite et le télécharger en MP3, sans inscription. Les voix proviennent de Kokoro, un modèle vocal d'IA ouvert, et s'exécutent dans votre navigateur : votre texte reste sur votre appareil. Idéal pour les voix off de vidéos courtes, la narration de diaporamas, la relecture à l'oreille et l'écoute de vos propres textes.

    Comment l'utiliser

    1. Saisissez ou collez votre texte dans la zone, ou ouvrez un fichier .txt.
    2. Choisissez une Voix et une Vitesse.
    3. Choisissez MP3 pour un fichier léger lisible partout, ou WAV pour le montage vidéo.
    4. Cliquez sur Créer la voix. La première fois, le modèle vocal est téléchargé une seule fois.
    5. Cliquez sur Lecture pour écouter, puis sur Télécharger.

    Conseils pour une parole naturelle

    • Écrivez les nombres, les dates et les prix de façon habituelle : « $19.99 », « 4 octobre » et « 9:30 » sont lus en entier.
    • La ponctuation donne le rythme : une virgule ajoute une courte pause et un nouveau paragraphe une pause plus longue.
    • Pour une voix off de vidéo, faites des phrases courtes et laissez une ligne vide à chaque changement de scène.
    • Si un nom est mal prononcé, écrivez-le comme il se prononce.
    • Besoin de sous-titres pour votre vidéo terminée ? Utilisez notre générateur de sous-titres gratuit.

    Crédits

    Les voix sont Kokoro-82M de hexgrad (Apache 2.0). Les prononciations utilisent les dictionnaires de misaki (Apache 2.0). Le modèle s'exécute avec ONNX Runtime Web (MIT), et les fichiers MP3 sont créés avec lamejs (LGPL). Mentions complètes : licences tierces.

    Gratuit, Pro et Pro+

    GratuitProPro+
    Texte par fichier audio1 000 caractères20 000 caractères20 000 caractères dans votre navigateur, 40 000 caractères avec les voix serveur rapides
    Un fichier audio par paragraphe, dans un ZIP—OuiOui
    Préréglages enregistrés—OuiOui
    Qualité du résultatIdentique dans votre navigateur avec tous les forfaitsIdentique dans votre navigateur, précision supérieure sur notre serveur
    Outils serveur utilisant des créditsAvec un pack de créditsAvec un pack de crédits300 crédits par mois

    Les crédits Pro+ servent à payer les outils serveur : conversion de la parole en texte haute précision, sous-titres automatiques haute précision, voix serveur rapides, ainsi que résumés, réponses et traduction de PDF avec IA. Un pack de crédits (150 crédits, valable 12 mois) fonctionne avec n'importe quelle offre. Comparer les offres.

    Questions fréquentes

    Puis-je utiliser l'audio dans des vidéos YouTube ou pour un usage commercial ?

    Oui. Le modèle vocal, Kokoro-82M, est publié sous licence Apache 2.0, qui autorise l'usage commercial, et nous n'ajoutons aucune condition à l'audio que vous créez. La voix est générée par IA : indiquez-le là où votre plateforme demande de signaler les contenus générés par IA.

    Mon texte est-il envoyé quelque part ?

    Non. Le modèle vocal s'exécute dans votre navigateur, sur votre propre appareil. Votre texte n'est envoyé ni à nos serveurs ni à personne d'autre. La seule exception concerne les voix rapides sur serveur de Pro+, que vous activez vous-même.

    Pourquoi la première exécution est-elle plus longue ?

    La première fois, votre navigateur télécharge le modèle vocal et son dictionnaire de prononciation, soit environ 97 MB. Ils sont conservés dans votre navigateur : les visites suivantes démarrent aussitôt.

    Combien de temps cela prend-il ?

    Cela dépend de votre appareil. Sur un ordinateur portable récent, l'audio est généralement créé plus vite qu'il ne se lit ; les téléphones et les ordinateurs plus anciens sont plus lents. La barre de progression indique l'avancement, et vous pouvez arrêter à tout moment.

    Quelles langues sont prises en charge ?

    L'anglais, avec des voix américaines. Les autres langues ne sont pas encore prises en charge.

    Pourquoi un mot est-il mal prononcé ?

    Les prononciations proviennent d'un dictionnaire d'environ 180 000 mots anglais. Les noms et les mots récents qui n'y figurent pas sont lus selon les règles d'orthographe, qui peuvent se tromper. Écrire le mot comme il se prononce, par exemple Shiv-awn pour Siobhan, règle généralement le problème.

    Quelles sont les limites ?

    La version gratuite lit jusqu'à 1 000 caractères à la fois, sans limite quotidienne. Avalon Pro lit jusqu'à 20 000 caractères à la fois, peut enregistrer un fichier audio par paragraphe dans un ZIP et conserve votre voix et votre vitesse sous forme de préréglages. Avalon Pro+ ajoute les voix serveur rapides pour les textes jusqu'à 40 000 caractères, payées avec des crédits.

    Recevez chaque nouvelle expérience par e-mail

    Un court e-mail à la fin de chaque mois : les expériences menées, les chiffres et les étapes à reproduire. Désabonnement possible à tout moment.