把任意文字变成带字幕的朗读 MP3
把稿子变成神经网络配音的 MP3,还附带与音频严丝合缝到毫秒的字幕。
稿子会发送到我们自己的合成接口,带着每个词的时间点作为 MP3 返回,不会保存在任何地方。只有这个引擎支持下载。
回车另起一段,Shift+回车在同一段里换行。每一段都可以单独指定语音,对话稿就是这样配出来的。
工作原理
把文稿拿进来
手打、粘贴,或者拖进一个 .txt、.md、.srt 或 .vtt。每一段都会变成可编辑的区块。导入的那一刻不会合成任何东西。
挑一个语音
按语言、地区或性别在 300 多种神经网络语音里筛选,先听一句样例,再决定要不要把整篇稿子交给它。
开始生成
每段单独合成,引擎会报告每个词落在什么位置。波形和字幕都靠这份数据。
带走成品
MP3 和 WAV 就是你刚刚听到的那段音频,外加用同一份时间信息做出来的 SRT 与 VTT 字幕。
像真人一样的声音
覆盖 140 个地区的 300 多种神经网络语音,其中的多语种语音在稿子切换语言时仍能保持同一副嗓音。
真正对得上的字幕
SRT 和 VTT 是用引擎针对这一次合成返回的逐词、逐句时间点拼出来的,而不是按阅读速度估算的。
一段一个声音
给每个区块单独指定语音,一次录完对话、访谈,或者角色众多的有声书。
语调由你掌控
速度、音调和音量既是整篇稿子的默认值,也能在某一句需要换个语气时逐块覆盖。
改稿不必从头来
改掉第七段的一个错字,重新合成的就只有第七段。已经做好的部分原封不动。
不联网也能用的引擎
本机引擎用你系统里已有的语音朗读文稿,一个请求都不发。仅供收听:浏览器不允许把它录下来。
一次合成,同时拿到旁白和字幕
写好或粘贴你的稿子,从 300 多种神经网络语音里挑一个,就能把成品音频连同由同一次合成做出的 SRT、VTT 字幕一起带走。每段都能有自己的声音、速度和音调,改动一句只会重新合成那一句。
音频到底在哪里生成,说明白
用本机引擎时,一切都发生在这个标签页里,用的是你系统里本来就有的语音。用神经网络引擎时,稿子会发到我们自己的接口,在那里合成后直接返回:中间没有第三方中转,不写入任何数据库,响应送出后也不留副本。这是唯一不在本地完成的环节,而恰恰是它让下载和字幕成为可能。
配音、学习与发布都用得上
给视频配上旁白,再把对应的字幕直接拖到时间轴上。把一篇长文变成通勤路上的音频。给课程配音,正文一个声音、例题换另一个。用耳朵校对自己写的东西,那些拼写检查抓不出的别扭句子会立刻现形。音频做好之后,字幕不用下载就能直接送进字幕工具。
你的文稿、历史记录和各项设置都只存在这个浏览器里,别无他处。神经网络引擎只会收到它需要念出来的那一段,回复之后什么都不留。没有账号,不分析你的文字,也不记录你让它读过什么。
常见问题
Q音频能下载吗?和我听到的是同一份吗?+
能。MP3 就是引擎产出的原始数据流,逐段拼接、不做二次编码,因此和播放器刚刚放出来的完全一致。WAV 是同一段音频的未压缩版本,方便偏好这种格式的剪辑软件。
Q字幕真的和音频对得上吗?+
对得上,因为它不是猜的。合成过程中,引擎会报告每个词、每句话开始的确切时刻和持续时长。SRT 和 VTT 就是按这些数字生成的,所以即使改了朗读速度也依然吻合。
Q我的文字会离开浏览器吗?+
用本机语音时,永远不会。用神经网络语音时,只有要朗读的那一段会发到我们自己的接口,它返回音频后什么也不保留。这是实话:不下载几百兆的模型,神经网络语音塞不进一个浏览器标签页。
Q有长度限制吗?+
每段上限 3000 个字符,大约一页纸;更长的导入内容会自动按句子边界切分。整篇稿子没有上限,但稿子很长就意味着请求很多,耗时也会按比例增加。
Q同一篇稿子里能用好几个声音吗?+
可以,分段的意义正在于此。展开任意区块,给它单独设定语音、速度、音调或音量。你没有覆盖的项目会继续沿用整篇稿子的默认值。
Q改一个错字会把整篇重做一遍吗?+
不会。每一段都记得自己是用什么文字和什么设置生成的,所以编辑之后只有真正变动过的段落会重新发送。在长篇旁白上,这就是几秒钟和好几分钟的差别。
Q为什么本机语音在每台电脑上听起来都不一样?+
因为它们属于操作系统,而不属于我们:Windows、macOS、Android、iOS 和 ChromeOS 各自带着自己的一套。装上语言包就能给这份列表添新声音。神经网络语音则相反,在哪里听都一样。