Herramienta gratis · Sin registro

Texto a voz gratis: voces naturales con IA, descarga en MP3

Última actualización: Por Avalon

Convierte texto en voz natural y descárgala como MP3 o WAV.

    Tu texto nunca sale de tu dispositivo. La voz la genera un modelo de IA que se ejecuta en tu navegador, así que no se sube nada a ningún servidor. El audio está generado por IA; indícalo allí donde lo publiques.

    Qué hace esta herramienta

    Para convertir texto en voz gratis, pega tu texto arriba, elige una voz y pulsa Crear voz: podrás reproducir el resultado al instante y descargarlo como MP3, sin registrarte. Las voces provienen de Kokoro, un modelo de voz de IA abierto, y se ejecutan en tu navegador, así que tu texto permanece en tu dispositivo. Es ideal para locuciones de videos cortos, narración de presentaciones, revisar textos escuchándolos y escuchar tus propios escritos.

    Cómo usarla

    1. Escribe o pega tu texto en el cuadro, o abre un archivo .txt.
    2. Elige una Voz y una Velocidad.
    3. Elige MP3 para un archivo pequeño que se reproduce en todas partes, o WAV para edición de video.
    4. Pulsa Crear voz. La primera vez, el modelo de voz se descarga una sola vez.
    5. Pulsa Reproducir para escuchar y luego Descargar.

    Consejos para una voz natural

    • Escribe los números, las fechas y los precios de la forma habitual: «$19.99», «4 de octubre» y «9:30» se leen completos.
    • La puntuación marca el ritmo: una coma añade una pausa corta y un párrafo nuevo, una pausa más larga.
    • Para una locución de video, usa frases cortas y deja una línea vacía donde cambie la escena.
    • Si un nombre suena mal, escríbelo tal como se pronuncia.
    • ¿Necesitas subtítulos para el video terminado? Usa nuestro creador de subtítulos gratuito.

    Créditos

    Las voces son Kokoro-82M de hexgrad (Apache 2.0). Las pronunciaciones usan los diccionarios de misaki (Apache 2.0). El modelo se ejecuta con ONNX Runtime Web (MIT) y los archivos MP3 se escriben con lamejs (LGPL). Avisos completos: licencias de terceros.

    Gratis, Pro y Pro+

    GratisProPro+
    Texto por archivo de audio1.000 caracteres20.000 caracteres20.000 caracteres en tu navegador, 40.000 caracteres con voces rápidas del servidor
    Un archivo de audio por párrafo, en un ZIP—SíSí
    Ajustes guardados—SíSí
    Calidad del resultadoIgual en tu navegador con cualquier planIgual en tu navegador, con mayor precisión en nuestro servidor
    Herramientas de servidor pagadas con créditosCon un paquete de créditosCon un paquete de créditos300 créditos cada mes

    Los créditos Pro+ sirven para pagar las herramientas de servidor: voz a texto de mayor precisión, subtítulos automáticos de mayor precisión, voces rápidas de servidor y resúmenes, respuestas y traducción de PDF con IA. Un paquete de créditos (150 créditos, válido durante 12 meses) funciona con cualquier plan. Comparar planes.

    Preguntas frecuentes

    ¿Puedo usar el audio en videos de YouTube o para trabajos comerciales?

    Sí. El modelo de voz, Kokoro-82M, se publica bajo la licencia Apache 2.0, que permite el uso comercial, y no añadimos ninguna condición propia al audio que creas. La voz está generada por IA: indícalo allí donde tu plataforma pida etiquetar contenido de IA.

    ¿Mi texto se sube a algún sitio?

    No. El modelo de voz se ejecuta dentro de tu navegador, en tu propio dispositivo. Tu texto no se envía a nuestros servidores ni a nadie más. La única excepción son las voces rápidas del servidor de Pro+, opcionales, que activas tú mismo.

    ¿Por qué la primera ejecución tarda más?

    La primera vez, tu navegador descarga el modelo de voz y su diccionario de pronunciación, unos 97 MB. Se guardan en tu navegador, así que las siguientes visitas empiezan al instante.

    ¿Cuánto tarda?

    Depende de tu dispositivo. En un portátil reciente, el audio suele crearse más rápido de lo que dura; los teléfonos y los equipos antiguos son más lentos. La barra de progreso muestra cuánto falta y puedes detenerlo en cualquier momento.

    ¿Qué idiomas habla?

    Inglés, con voces estadounidenses. Todavía no se admiten otros idiomas.

    ¿Por qué una palabra suena mal?

    Las pronunciaciones provienen de un diccionario de unas 180.000 palabras en inglés. Los nombres y las palabras nuevas que no están en él se leen según reglas de ortografía, que pueden fallar. Escribir la palabra tal como suena, por ejemplo Shiv-awn para Siobhan, suele solucionarlo.

    ¿Cuáles son los límites?

    La versión gratuita convierte hasta 1.000 caracteres a la vez, sin límite diario. Avalon Pro convierte hasta 20.000 caracteres a la vez, puede guardar un archivo de audio por párrafo en un ZIP y conserva tu voz y velocidad como ajustes guardados. Avalon Pro+ añade voces rápidas del servidor para textos de hasta 40.000 caracteres, que se pagan con créditos.

    Recibe cada nuevo experimento por correo

    Un correo breve al final de cada mes: los experimentos que hicimos, los números y los pasos que puedes copiar. Cancela cuando quieras.