短视频方言配音
一位美食博主拍完一期「潮汕牛肉火锅」教程,原声口音太重,字幕又赶不上画面。他需要一种既保留地域风味、又比本人普通话清晰的旁白。用本工具选择中文多音色,调出带轻微南方口音的男声,语速设为 1.1 倍,把解说词逐句合成。成品比原声干净,又没丢掉「本地人」的烟火气,视频完播率比上一期高了 12%。
你的浏览器未提供 Web Speech API(speechSynthesis)。请改用较新版本的 Chrome / Edge / Safari,或在系统自带浏览器中打开本页。文字输入与分句仍可正常使用。
录完一段旁白,发现语速不对、音色不贴,重录又得折腾半天。这个工具把文字直接转成语音,用 Piper 和 eSpeak 引擎提供中英文多音色选择,输出 WAV 或 MP3。参数调好再生成,不用反复录制。音频在后端处理,文件会暂存服务器,建议敏感内容生成后及时下载删除。
一位美食博主拍完一期「潮汕牛肉火锅」教程,原声口音太重,字幕又赶不上画面。他需要一种既保留地域风味、又比本人普通话清晰的旁白。用本工具选择中文多音色,调出带轻微南方口音的男声,语速设为 1.1 倍,把解说词逐句合成。成品比原声干净,又没丢掉「本地人」的烟火气,视频完播率比上一期高了 12%。
考研英语二战考生,真题听力已经背得出选项位置。他需要全新的、语速可控的英文材料来训练「盲听反应」。把历年阅读真题里长难句复制进工具,选 espeak 英式发音,语速从 0.8 倍开始,每三天提 0.05 倍。两周后他能在 1.0 倍速下听写 90% 的从句结构,且不依赖任何流媒体平台的推荐算法。
一个独立作者写完 15 万字悬疑小说,想投给有声平台但没钱请专业主播试录。他需要一段 3 分钟的样章来展示故事节奏。用 piper 多音色分别合成「阴冷旁白」「急促对话」「老年角色独白」三个片段,再用剪辑软件拼成一条 demo。平台编辑听完后直接给了签约意向,因为样章证明了文本本身的声音表现力。
一位视障父亲想给 4 岁女儿读《好饿的毛毛虫》,但盲文绘本只有文字,没有语音点读功能。他把绘本每页文字逐句粘贴进工具,选中文童声音色,语速降到 0.85 倍,每句间隔手动加 0.3 秒静音。女儿听着合成音翻页,父亲在旁边摸盲文确认进度。这个流程让他每晚能独立完成 20 分钟的亲子共读,不再需要妻子代劳。
一家物流公司要更新 40 页「分拣操作安全规范」PPT,原配音员工已离职,新招的兼职配音员报价每页 80 元且要排期一周。培训主管用本工具,选中文标准男声,把每页讲解词分段合成,导出后直接嵌入 PPT 自动播放。总耗时 45 分钟,成本为零,且后续修改操作流程时只需替换对应段落音频,不用重新约人录音。
| 输入 | 输出 | 说明 |
|---|---|---|
| 你好,世界。 | nǐ hǎo, shì jiè. | 常规:中文短句,验证中文拼音转换及标点处理。 |
| Hello, world! | hɛˈloʊ, wɜːld! | 常规:英文短句,验证英文音标输出及标点保留。 |
| 12345 | yī èr sān sì wǔ | 常规:纯数字,验证数字转中文读音。 |
| (无输出) | 边界:空输入,验证工具对空字符串的处理(应返回空或提示)。 | |
| a | eɪ | 边界:单个英文字母,验证单字母音标映射。 |
| 你好Hello世界123 | nǐ hǎo hɛˈloʊ shì jiè yī èr sān | 混合:中英文数字混排,验证多语种混合输入的处理能力。 |
| 𠮷𠮷𠮷 | jí jí jí | 易错:Unicode 扩展B区汉字(𠮷),验证非常用汉字的拼音映射是否完整。 |
1.中文文本里混入了全角标点,导致合成停顿异常
今天天气真好。我们去公园吧!今天天气真好。我们去公园吧!Piper 和 eSpeak 的词边界检测依赖半角空格和半角标点。全角句号、感叹号会被当作字符本身处理,合成时可能产生非预期停顿或连读。
2.英文文本里数字没写完整,被读成单个数字
The year is 2025.The year is two thousand twenty-five.eSpeak 对数字默认按位读出(2-0-2-5)。要得到自然年份读法,必须将数字写成英文单词。Piper 多语言模型对此略有改善,但仍建议关键数字拼写。
3.中文英文混排时,没加空格导致英文单词被当拼音处理
请打开WIFI设置请打开 WIFI 设置Piper 中文模型遇到连续字母会尝试按拼音拼读。在中文与英文之间加空格,模型才能正确切换语言模式。
4.使用 eSpeak 时,中文文本里包含生僻字导致无声或错误发音
魑魅魍魉,四小鬼各自肚肠魑魅魍魉,四小鬼各自肚肠(或替换为常见同音字)eSpeak 中文词库仅覆盖约 6000 常用汉字,生僻字(如魑、魅、魍、魉)会直接跳过或发默认音。Piper 模型对此有改善,但建议关键内容用常见字。
5.英文缩写没加句点,被当单词读
NASA launched a rocket.N.A.S.A. launched a rocket.eSpeak 对连续大写字母默认按单词处理(读作“纳萨”)。加句点后引擎会逐字母读出。Piper 模型对常见缩写(NASA、FBI)有内置词典,但非常见缩写仍需加句点。
6.文本里包含 HTML 标签或 Markdown 语法,被当成文字念出来
请点击<b>这里</b>请点击这里TTS 引擎不解析标记语言,<b> 会被当作字符序列读出。合成前必须移除所有非文本标记。
7.中文文本里用了繁体字,合成音调异常
今天天氣真好今天天气真好Piper 中文模型主要基于简体字训练,繁体字映射到拼音时可能匹配错误声调。建议合成前将文本转为简体。
8.超长文本不切分,合成到一半卡死或输出截断
(一段 10000 字的文章直接粘贴)(将长文本按段落或 2000 字以内分批合成)Piper 和 eSpeak 均对单次输入长度有限制(通常 5000-8000 字符)。超长文本会导致浏览器内存溢出或后端超时。建议按自然段落分批处理。
T = (L × 60) / (S × R)
T合成音频时长,单位秒L输入文本总字符数(含空格)S语速倍率,1.0 为正常R音色基准速率,单位字符/秒输入 120 个中文字符(含标点),语速设为 1.2 倍,Piper 中文音色基准速率约 8 字符/秒:T = (120 × 60) / (1.2 × 8) = 7200 / 9.6 = 750 秒(约 12.5 分钟)。
可以。Piper 和 eSpeak 都支持中英文混合输入,但实现方式不同。Piper 的中文模型对英文单词(如“iPhone”“AI”)会尝试按英文发音读,而 eSpeak 需要手动指定语言标签(如 <lang=en>Hello</lang>)才能切换。如果发现英文单词被按拼音读,建议在英文单词前后加空格,或改用 Piper 的中英混合模型。本工具默认开启自动语言检测,但长段纯英文建议选英文音色。
不是漏读,是默认语速偏快。Piper 和 eSpeak 的默认语速约 150-180 字/分钟,5000 字按此速度约需 1.5-2 分钟,但如果你选的音色是快速朗读型(如 eSpeak 的默认英文男声),实际可能更快。本工具界面有语速滑块(0.5x-2.0x),调低到 0.8x 可让语速接近日常说话节奏。另外注意:输入框下方显示的是字符数(含标点),不是实际朗读字数,中文字符一字一音但英文单词算多个字符。
差别很大。Piper 基于神经网络(VITS 架构),生成的语音接近真人,有语调起伏和自然停顿,尤其英文多音色模型(如“ljspeech”“libritts”)听起来像录音棚录的。eSpeak 是参数合成器(共振峰合成),声音机械感强,像早期导航语音,但优势是体积极小(几百 KB)且响应极快(毫秒级生成)。本工具默认用 Piper 模型,如果你对音质要求高选 Piper,对生成速度或离线部署有要求才选 eSpeak。
本工具默认输出 WAV 格式(16kHz 采样率、16bit 单声道),因为 Piper 和 eSpeak 原生输出就是 WAV。如果你需要 MP3,可以在生成后使用本站在线音频转换工具(/yinpin/format)转码,或直接用本地播放器/剪辑软件转。注意:WAV 是无损格式,文件体积较大(1 分钟约 1.8MB),MP3 压缩后约 200KB,但音质差别不明显,因为 TTS 生成的语音本身频率范围有限。
Piper 模型在 CPU 上生成长文本时,处理时间与字符数成正比,10000 字约需 10-30 秒(取决于服务器负载和模型大小)。如果超过 1 分钟仍无结果,可能是输入包含特殊字符(如连续换行、Unicode 控制字符)导致模型解析卡住。建议分段输入(每段 2000-3000 字),或检查文本末尾是否有未闭合的引号/括号。本工具后端有超时保护(60 秒),超时会自动提示,无需刷新页面。
可以商用,但需注意模型版权。Piper 使用的训练数据(如 LJ Speech、LibriTTS)均为 CC0 或公共领域,生成的语音无需署名,可自由用于商业项目(YouTube 视频、播客、有声书等)。eSpeak 是 GPL 协议,如果你直接用生成的音频文件而不用它的代码,同样不触发 GPL 传染(类似用 GIMP 导出的图片)。本工具不额外附加协议,生成的音频归用户所有。但建议不要用名人声音模型(如果有)做音色模仿,以免肖像权风险。
不同音色的语速基准不同。Piper 的多音色模型(如“ljspeech”女声、“libritts”男声)在训练时用了不同语速的录音数据,即使本工具设置了相同的语速滑块(如 1.0x),实际朗读速度仍可能有 10%-20% 差异。另外有些音色(如“vctk”系列)包含不同说话人的发音习惯(喜欢拖长音或连读),也会影响总时长。如果需要精确控制时长,建议先用短文本测试选定音色,再批量生成。
取决于你用的模型。Piper 的中文模型(基于中文 TTS 数据集)对常见日期格式(YYYY年MM月DD日)会按“二零二五年三月十五日”朗读,符合日常习惯。但如果是纯数字串(如“2025”单独出现),Piper 会读成“两千零二十五”(少数模型)或“二零二五”(多数模型)。eSpeak 中文模式则统一按数字逐个读(“二 零 二 五”),不识别日期格式。建议对日期、电话号码等特定格式,在输入时用汉字写(“二〇二五年三月十五日”)以获得最准确读音。
隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。