Transforme qualquer texto num MP3 narrado com legendas
Transforma um roteiro num MP3 narrado com vozes neurais e devolve legendas que encaixam ao milissegundo.
O roteiro viaja até o nosso próprio endpoint de síntese, volta como MP3 com o tempo de cada palavra e não fica guardado em lugar nenhum. É o motor que permite baixar.
Enter começa um novo parágrafo, Shift+Enter mantém a quebra de linha dentro dele. Cada parágrafo pode ter a própria voz: é assim que se narra um diálogo.
Como funciona
Traga o roteiro
Digite, cole ou solte um .txt, .md, .srt ou .vtt. Cada parágrafo vira um bloco editável. Na chegada não se sintetiza nada.
Escolha a voz
Vasculhe mais de 300 vozes neurais por idioma, região ou gênero, e ouça uma frase de amostra antes de comprometer o roteiro inteiro.
Gere
Cada parágrafo é sintetizado por conta própria e o motor informa onde cai cada palavra. É isso que alimenta a onda e as legendas.
Leve embora
MP3 e WAV com exatamente o áudio que você acabou de ouvir, mais legendas SRT e VTT feitas com esses mesmos tempos.
Vozes que soam humanas
Mais de 300 vozes neurais em 140 regiões, incluindo as multilíngues, que mantêm o mesmo timbre quando o roteiro muda de idioma.
Legendas que encaixam mesmo
Os arquivos SRT e VTT são montados com os tempos de palavra e frase que o motor devolve para aquela síntese específica, não estimados por uma velocidade de leitura.
Uma voz por parágrafo
Dê a cada bloco a própria voz e narre um diálogo, uma entrevista ou um audiolivro com vários personagens numa única passada.
Prosódia sob seu controle
Velocidade, tom e volume como padrão de todo o roteiro, e ajustáveis bloco a bloco sempre que uma frase pedir outra entonação.
Editar sem recomeçar
Você corrige um erro no parágrafo sete e só o parágrafo sete é gerado de novo. Tudo o que já estava pronto continua igual.
Um motor sem rede
O motor do dispositivo lê seu roteiro com as vozes que o seu sistema já tem, sem nenhuma requisição. Só para ouvir: o navegador não deixa gravar.
Narração e legendas de uma só geração
Escreva ou cole seu roteiro, escolha entre mais de 300 vozes neurais e leve o áudio pronto junto com legendas SRT e VTT feitas a partir dessa mesma geração. Cada parágrafo pode ter voz, velocidade e tom próprios, e editar uma frase só regenera aquela frase.
Onde o áudio é feito, dito com clareza
Com o motor do dispositivo tudo acontece dentro desta aba, usando as vozes que o seu sistema já tem. Com o motor neural o roteiro é enviado ao nosso próprio endpoint, sintetizado e devolvido direto: sem intermediários de terceiros, sem escrever nada em banco de dados e sem guardar cópia depois de entregar a resposta. É a única parte que não é local, e é justamente ela que torna possíveis o download e as legendas.
Para narrar, estudar e publicar
Dê voz a um vídeo e arraste as legendas correspondentes para a linha do tempo. Transforme um artigo longo em áudio para o trajeto. Narre um curso com uma voz para a aula e outra para os exemplos. Revise seus próprios textos de ouvido, que denuncia frases tortas que nenhum corretor pega. E quando o áudio estiver pronto, mande as legendas para a ferramenta de legendas sem baixar nada.
Seus roteiros, seu histórico e suas preferências vivem neste navegador e em nenhum outro lugar. O motor neural recebe apenas o parágrafo que precisa dizer em voz alta e não guarda nada depois de responder. Não há conta, não há análise do seu texto e não há registro do que você mandou ler.
Perguntas frequentes
QPosso baixar o áudio? É o mesmo que eu ouvi?+
Sim. O MP3 é o fluxo intacto produzido pelo motor, emendado parágrafo a parágrafo e sem recodificar, então é idêntico ao que o player acabou de tocar. O WAV é esse mesmo áudio sem compressão, para os editores que preferem assim.
QAs legendas encaixam mesmo com o áudio?+
Encaixam, porque não são adivinhadas. Durante a síntese, o motor informa o instante exato em que cada palavra e cada frase começam e quanto duram. O SRT e o VTT são montados com esses números, então continuam certos mesmo se você mudar a velocidade de leitura.
QMeu texto sai do navegador?+
Com as vozes do dispositivo, nunca. Com as neurais, o parágrafo que será narrado vai até o nosso próprio endpoint, que devolve o áudio e não guarda nada. Essa é a resposta honesta: vozes neurais não cabem numa aba sem baixar um modelo de centenas de megabytes.
QExiste limite de tamanho?+
Cada parágrafo vai até 3.000 caracteres, cerca de uma página de texto; importações maiores são divididas automaticamente no fim das frases. O roteiro inteiro não tem teto, mas um muito longo significa muitos pedidos e demora proporcional.
QPosso usar várias vozes no mesmo roteiro?+
Sim, e é para isso que ele é dividido em parágrafos. Abra qualquer bloco e dê a ele a própria voz, velocidade, tom ou volume. Tudo o que você não alterar continua seguindo o padrão do roteiro.
QSe eu corrigir um erro de digitação, tudo é gerado de novo?+
Não. Cada parágrafo lembra o texto e os ajustes com que foi gerado, então depois de editar só voltam a ser enviados os que realmente mudaram. Numa narração longa isso é a diferença entre alguns segundos e vários minutos.
QPor que as vozes do dispositivo soam diferentes em cada computador?+
Porque pertencem ao sistema operacional, não a nós: Windows, macOS, Android, iOS e ChromeOS trazem cada um o seu conjunto. Instalar pacotes de idioma acrescenta vozes a essa lista. As neurais, por outro lado, soam iguais em qualquer lugar.