Transformez n'importe quel texte en MP3 narré avec sous-titres
Transformez un script en MP3 narré avec des voix neuronales et récupérez des sous-titres calés à la milliseconde.
Le script part vers notre propre point de synthèse, revient en MP3 avec le minutage de chaque mot, et n'est stocké nulle part. C'est le moteur qui permet le téléchargement.
Entrée commence un nouveau paragraphe, Maj+Entrée garde un saut de ligne à l'intérieur. Chaque paragraphe peut avoir sa propre voix : c'est ainsi qu'on narre un dialogue.
Comment ça marche
Amenez le script
Tapez-le, collez-le ou déposez un .txt, .md, .srt ou .vtt. Chaque paragraphe devient un bloc modifiable. Rien n'est synthétisé à l'arrivée.
Choisissez la voix
Fouillez plus de 300 voix neuronales par langue, région ou genre, et écoutez une phrase d'exemple avant d'y engager tout le script.
Générez
Chaque paragraphe est synthétisé séparément et le moteur indique où tombe chaque mot. C'est ce qui alimente la forme d'onde et les sous-titres.
Emportez le tout
MP3 et WAV de l'audio exact que vous venez d'entendre, plus des sous-titres SRT et VTT issus du même minutage.
Des voix qui sonnent humaines
Plus de 300 voix neuronales dans 140 régions, dont des voix multilingues qui gardent le même timbre quand le script change de langue.
Des sous-titres vraiment calés
Les fichiers SRT et VTT sont bâtis sur le minutage des mots et des phrases que le moteur renvoie pour cette génération précise, et non estimés à partir d'une vitesse de lecture.
Une voix par paragraphe
Donnez à chaque bloc sa propre voix et narrez un dialogue, un entretien ou un livre audio à plusieurs personnages en une seule passe.
La prosodie sous contrôle
Vitesse, hauteur et volume comme réglages généraux du script, ajustables bloc par bloc dès qu'une phrase demande un autre ton.
Modifier sans tout refaire
Vous corrigez une coquille au paragraphe sept et seul le paragraphe sept est régénéré. Tout ce qui était déjà fait reste intact.
Un moteur sans réseau
Le moteur de l'appareil lit votre script avec les voix que votre système possède déjà, sans la moindre requête. Écoute seulement : le navigateur ne permet pas de l'enregistrer.
Narration et sous-titres d'une seule génération
Écrivez ou collez votre script, choisissez parmi plus de 300 voix neuronales et repartez avec l'audio fini accompagné de sous-titres SRT et VTT issus de cette même génération. Chaque paragraphe peut avoir sa voix, sa vitesse et sa hauteur, et modifier une phrase ne régénère que cette phrase.
Où l'audio est fabriqué, dit simplement
Avec le moteur de l'appareil, tout se passe dans cet onglet, avec les voix que votre système possède déjà. Avec le moteur neuronal, le script est envoyé à notre propre point de synthèse, converti et renvoyé directement : aucun relais tiers au milieu, rien d'écrit dans une base de données et aucune copie conservée une fois la réponse remise. C'est la seule partie qui n'est pas locale, et c'est elle qui rend possibles le téléchargement et les sous-titres.
Pour narrer, réviser et publier
Posez une voix off sur une vidéo et déposez les sous-titres correspondants sur la timeline. Transformez un long article en audio pour le trajet. Donnez sa narration à un cours, une voix pour la leçon et une autre pour les exemples. Relisez vos textes à l'oreille : elle repère les phrases bancales qu'aucun correcteur ne voit. Et quand l'audio est prêt, envoyez les sous-titres vers l'outil dédié sans rien télécharger.
Vos scripts, votre historique et vos réglages vivent dans ce navigateur et nulle part ailleurs. Le moteur neuronal ne reçoit que le paragraphe qu'il doit dire à voix haute, et ne garde rien après avoir répondu. Pas de compte, aucune analyse de votre texte, aucun journal de ce que vous avez fait lire.
Questions fréquentes
QPuis-je télécharger l'audio, et est-ce bien celui que j'ai entendu ?+
Oui. Le MP3 est le flux intact produit par le moteur, assemblé paragraphe par paragraphe et sans réencodage : il est identique à ce que le lecteur vient de jouer. Le WAV est ce même audio non compressé, pour les logiciels de montage qui le préfèrent.
QLes sous-titres collent-ils vraiment à l'audio ?+
Oui, parce qu'ils ne sont pas devinés. Pendant la synthèse, le moteur signale l'instant exact où commence chaque mot et chaque phrase, et leur durée. Le SRT et le VTT sont bâtis sur ces chiffres : ils restent calés même si vous changez la vitesse de lecture.
QMon texte quitte-t-il le navigateur ?+
Avec les voix de l'appareil, jamais. Avec les voix neuronales, le paragraphe à narrer part vers notre propre point de synthèse, qui renvoie l'audio et ne garde rien. C'est la réponse honnête : une voix neuronale ne tient pas dans un onglet sans télécharger un modèle de plusieurs centaines de mégaoctets.
QY a-t-il une limite de longueur ?+
Chaque paragraphe est plafonné à 3 000 caractères, soit une page de texte ; les imports plus longs sont coupés automatiquement en fin de phrase. Le script entier n'a pas de plafond, mais un script très long implique beaucoup de requêtes et prend proportionnellement plus de temps.
QPuis-je utiliser plusieurs voix dans un même script ?+
Oui, et c'est tout l'intérêt du découpage en paragraphes. Ouvrez un bloc et donnez-lui sa voix, sa vitesse, sa hauteur ou son volume. Tout ce que vous ne changez pas continue de suivre le réglage général.
QSi je corrige une coquille, tout est-il régénéré ?+
Non. Chaque paragraphe retient le texte et les réglages avec lesquels il a été généré : après une modification, seuls ceux qui ont réellement changé repartent. Sur une longue narration, c'est la différence entre quelques secondes et plusieurs minutes.
QPourquoi les voix de l'appareil sonnent-elles différemment sur chaque ordinateur ?+
Parce qu'elles appartiennent au système d'exploitation, pas à nous : Windows, macOS, Android, iOS et ChromeOS livrent chacun leur propre jeu. Installer des modules linguistiques ajoute des voix à cette liste. Les voix neuronales, elles, sonnent pareil partout.