Convierte cualquier texto en un MP3 narrado con subtítulos
Convierte un guion en un MP3 narrado con voces neuronales y consigue subtítulos que encajan al milisegundo.
El guion viaja a nuestro propio endpoint de síntesis, vuelve como MP3 con los tiempos de cada palabra y no se guarda en ningún sitio. Es el motor que permite descargar.
Intro empieza un párrafo nuevo, Mayús+Intro mantiene el salto de línea dentro del mismo. Cada párrafo puede llevar su propia voz: así se narra un diálogo.
Cómo funciona
Trae el guion
Escríbelo, pégalo o suelta un .txt, .md, .srt o .vtt. Cada párrafo se convierte en un bloque editable. Al llegar no se sintetiza nada.
Elige la voz
Busca entre más de 300 voces neuronales por idioma, región o género, y escucha una frase de muestra antes de comprometer todo el guion.
Genéralo
Cada párrafo se sintetiza por separado y el motor informa de dónde cae cada palabra. Eso es lo que alimenta la onda y los subtítulos.
Llévatelo
MP3 y WAV con exactamente el audio que acabas de oír, más subtítulos SRT y VTT hechos con esos mismos tiempos.
Voces que suenan a persona
Más de 300 voces neuronales en 140 regiones, incluidas las multilingües, que mantienen el mismo timbre cuando el guion cambia de idioma.
Subtítulos que encajan de verdad
Los archivos SRT y VTT se construyen con los tiempos de palabra y frase que el motor devuelve para esa síntesis concreta, no estimados a partir de una velocidad de lectura.
Una voz por párrafo
Dale a cada bloque su propia voz y narra un diálogo, una entrevista o un audiolibro con varios personajes de una sola pasada.
Prosodia bajo tu control
Velocidad, tono y volumen como valores generales del guion, y ajustables bloque a bloque cuando una frase pide otra entonación.
Editar sin empezar de cero
Corriges una errata del párrafo siete y solo se vuelve a sintetizar el párrafo siete. Lo ya generado se queda tal cual estaba.
Un motor sin red
El motor del dispositivo lee tu guion con las voces que ya tiene tu sistema operativo, sin que salga ninguna petición. Solo para escuchar: el navegador no deja grabarlo.
Narración y subtítulos de una sola generación
Escribe o pega tu guion, elige entre más de 300 voces neuronales y llévate el audio terminado junto con subtítulos SRT y VTT hechos a partir de esa misma síntesis. Cada párrafo puede tener su voz, su velocidad y su tono, y editar una frase solo regenera esa frase.
Dónde se fabrica el audio, dicho claro
Con el motor del dispositivo todo ocurre dentro de esta pestaña, usando las voces que ya tiene tu sistema. Con el motor neuronal el guion se envía a nuestro propio endpoint, se sintetiza y vuelve directamente: sin intermediarios de terceros, sin escribir nada en ninguna base de datos y sin conservar copia una vez entregada la respuesta. Es la única parte que no es local, y es la que hace posibles la descarga y los subtítulos.
Para narrar, estudiar y publicar
Pon voz a un vídeo y arrastra los subtítulos que le corresponden a la línea de tiempo. Convierte un artículo largo en audio para el camino al trabajo. Dale narración a un curso con una voz para la lección y otra para los ejemplos. Repasa de oído lo que has escrito, que delata frases torpes que ningún corrector detecta. Y cuando el audio esté listo, manda los subtítulos a la herramienta de subtítulos sin descargar nada.
Tus guiones, tu historial y tus ajustes viven en este navegador y en ningún otro sitio. El motor neuronal solo recibe el párrafo que tiene que decir en voz alta y no conserva nada después de responder. No hay cuenta, no hay analítica sobre tu texto y no hay registro de lo que le has hecho leer.
Preguntas frecuentes
Q¿Puedo descargar el audio? ¿Es el mismo que he escuchado?+
Sí. El MP3 es el flujo intacto que produjo el motor, unido párrafo a párrafo y sin recodificar, así que es idéntico a lo que acaba de sonar en el reproductor. El WAV es ese mismo audio sin comprimir, para los editores que lo prefieren.
Q¿Los subtítulos encajan de verdad con el audio?+
Sí, porque no se adivinan. Mientras sintetiza, el motor informa del instante exacto en que empieza cada palabra y cada frase y de cuánto duran. El SRT y el VTT se construyen con esos números, así que siguen cuadrando aunque cambies la velocidad de lectura.
Q¿Mi texto sale del navegador?+
Con las voces del dispositivo, nunca. Con las neuronales, el párrafo que se va a narrar se envía a nuestro propio endpoint, que devuelve el audio y no guarda nada. Esa es la respuesta honesta: las voces neuronales no caben en una pestaña sin descargar un modelo de cientos de megas.
Q¿Hay límite de longitud?+
Cada párrafo llega hasta 3.000 caracteres, que es una página de texto; lo que importes más largo se parte solo por final de frase. El guion entero no tiene tope, aunque uno muy largo implica muchas peticiones y tarda en proporción.
Q¿Puedo usar varias voces en un mismo guion?+
Sí, y para eso está dividido en párrafos. Abre cualquier bloque y dale su propia voz, velocidad, tono o volumen. Todo lo que no cambies seguirá el valor general del guion.
QSi corrijo una errata, ¿se vuelve a generar todo?+
No. Cada párrafo recuerda el texto y los ajustes con los que se generó, así que tras editar solo se reenvían los que han cambiado de verdad. En una narración larga eso es la diferencia entre unos segundos y varios minutos.
Q¿Por qué las voces del dispositivo suenan distintas en cada ordenador?+
Porque son del sistema operativo, no nuestras: Windows, macOS, Android, iOS y ChromeOS traen cada uno su propio juego. Instalar paquetes de idioma añade voces a esa lista. Las neuronales, en cambio, suenan igual en todas partes.