Ferramenta grátis · Sem cadastro

Texto para Fala Grátis: Vozes Naturais de IA, Download em MP3

Última atualização: Por Avalon

Transforme texto em fala com som natural e baixe em MP3 ou WAV.

    Seu texto nunca sai do seu dispositivo. A voz é criada por um modelo de IA que roda no seu navegador, então nada é enviado para um servidor. O áudio é gerado por IA; informe isso onde você o publicar.

    O que esta ferramenta faz

    Para converter texto em fala de graça, cole seu texto acima, escolha uma voz e clique em Criar fala: você pode ouvir o resultado na hora e baixá-lo como MP3, sem cadastro. As vozes vêm do Kokoro, um modelo de voz de IA de código aberto, e rodam no seu navegador, então seu texto fica no seu dispositivo. Serve para narrações de vídeos curtos, locução de slides, revisão de textos de ouvido e para ouvir seus próprios escritos.

    Como usar

    1. Digite ou cole seu texto na caixa, ou abra um arquivo .txt.
    2. Escolha uma Voz e uma Velocidade.
    3. Escolha MP3 para um arquivo pequeno que toca em qualquer lugar, ou WAV para edição de vídeo.
    4. Clique em Criar fala. Na primeira vez, o modelo de voz é baixado uma única vez.
    5. Clique em Reproduzir para ouvir e depois em Baixar.

    Dicas para uma fala natural

    • Escreva números, datas e preços do jeito normal: "$19.99", "4 de outubro" e "9:30" são lidos por extenso.
    • A pontuação dá o ritmo: uma vírgula faz uma pausa curta e um novo parágrafo, uma pausa mais longa.
    • Para uma narração de vídeo, use frases curtas e deixe uma linha em branco onde a cena muda.
    • Se um nome soar errado, escreva-o do jeito que se pronuncia.
    • Precisa de legendas para o vídeo pronto? Use nosso criador de legendas gratuito.

    Créditos

    As vozes são do Kokoro-82M, de hexgrad (Apache 2.0). As pronúncias usam os dicionários do misaki (Apache 2.0). O modelo roda com o ONNX Runtime Web (MIT) e os arquivos MP3 são gerados com o lamejs (LGPL). Avisos completos: licenças de terceiros.

    Grátis, Pro e Pro+

    GrátisProPro+
    Texto por arquivo de áudio1.000 caracteres20.000 caracteres20.000 caracteres no navegador, 40.000 caracteres com vozes rápidas do servidor
    Um arquivo de áudio por parágrafo, em ZIP—SimSim
    Predefinições salvas—SimSim
    Qualidade do resultadoO mesmo no seu navegador em todos os planosO mesmo no seu navegador, com maior precisão em nosso servidor
    Ferramentas de servidor pagas com créditosCom um pacote de créditosCom um pacote de créditos300 créditos por mês

    Os créditos do Pro+ pagam as ferramentas de servidor: fala para texto de maior precisão, legendas automáticas de maior precisão, vozes rápidas no servidor e resumos, respostas e tradução de PDF com IA. Um pacote de créditos (150 créditos, válido por 12 meses) funciona em qualquer plano. Comparar planos.

    Perguntas frequentes

    Posso usar o áudio em vídeos do YouTube ou em trabalhos comerciais?

    Sim. O modelo de voz, Kokoro-82M, é distribuído sob a licença Apache 2.0, que permite uso comercial, e não adicionamos nenhuma condição adicional ao áudio que você cria. A voz é gerada por IA: informe isso onde a sua plataforma pedir para identificar conteúdo de IA.

    Meu texto é enviado para algum lugar?

    Não. O modelo de voz roda dentro do seu navegador, no seu próprio dispositivo. Seu texto não é enviado para os nossos servidores nem para ninguém. A única exceção são as vozes rápidas do servidor do Pro+, que são opcionais e que você mesmo ativa.

    Por que a primeira execução demora mais?

    Na primeira vez, seu navegador baixa o modelo de voz e o dicionário de pronúncia, cerca de 97 MB. Eles ficam guardados no navegador, então as próximas visitas começam na hora.

    Quanto tempo leva?

    Depende do seu dispositivo. Em um notebook recente, o áudio costuma ser criado em menos tempo do que leva para tocar; celulares e computadores mais antigos são mais lentos. A barra de progresso mostra o andamento e você pode parar a qualquer momento.

    Quais idiomas ele fala?

    Inglês, com vozes americanas. Outros idiomas ainda não são compatíveis.

    Por que uma palavra soa errada?

    As pronúncias vêm de um dicionário com cerca de 180.000 palavras em inglês. Nomes e palavras novas que não estão nele são lidos por regras de escrita, que podem errar. Escrever a palavra do jeito que ela soa, por exemplo Shiv-awn para Siobhan, geralmente resolve.

    Quais são os limites?

    A versão gratuita narra até 1.000 caracteres por vez, sem limite diário. O Avalon Pro narra até 20.000 caracteres por vez, pode salvar um arquivo de áudio por parágrafo em um ZIP e guarda sua voz e velocidade como predefinições. O Avalon Pro+ adiciona vozes rápidas do servidor para textos de até 40.000 caracteres, pagas com créditos.

    Receba cada novo experimento por e-mail

    Um e-mail curto no fim de cada mês: os experimentos que fizemos, os números e os passos que você pode copiar. Cancele a assinatura quando quiser.