音频工具 · 杂项

文字转语音

piper/espeak 中文/英文/多音色

本地处理 · 不上传 免费 · 无需登录 无次数限制 累计 43 次使用
浏览器原生语音合成 · 纯本地 · 不上传 · 无需联网模型
!
当前浏览器不支持语音合成

你的浏览器未提供 Web Speech API(speechSynthesis)。请改用较新版本的 Chrome / Edge / Safari,或在系统自带浏览器中打开本页。文字输入与分句仍可正常使用。

字数 0 · 分句 0 约可读 0 秒(按当前语速估算)
1.00×
1.00
100%
空闲 进度 0 / 0 音色
朗读预览boundary highlight · 当前句赤金底 / 当前词朱砂
输入文字后,朗读时此处逐句高亮…
关于导出音频:浏览器原生语音合成(speechSynthesis)不经过 Web Audio 音频图,无法在前端直接录制为文件。如需音频文件,可用系统录音功能,或使用本站「录音」类工具录制。本工具专注于即时朗读与逐句高亮。
就绪 · 输入文字后点「朗读」即可逐句播放
第一节

关于本工具

About

录完一段旁白,发现语速不对、音色不贴,重录又得折腾半天。这个工具把文字直接转成语音,用 Piper 和 eSpeak 引擎提供中英文多音色选择,输出 WAV 或 MP3。参数调好再生成,不用反复录制。音频在后端处理,文件会暂存服务器,建议敏感内容生成后及时下载删除。

使用场景

短视频方言配音

一位美食博主拍完一期「潮汕牛肉火锅」教程,原声口音太重,字幕又赶不上画面。他需要一种既保留地域风味、又比本人普通话清晰的旁白。用本工具选择中文多音色,调出带轻微南方口音的男声,语速设为 1.1 倍,把解说词逐句合成。成品比原声干净,又没丢掉「本地人」的烟火气,视频完播率比上一期高了 12%。

外语听力磨耳朵

考研英语二战考生,真题听力已经背得出选项位置。他需要全新的、语速可控的英文材料来训练「盲听反应」。把历年阅读真题里长难句复制进工具,选 espeak 英式发音,语速从 0.8 倍开始,每三天提 0.05 倍。两周后他能在 1.0 倍速下听写 90% 的从句结构,且不依赖任何流媒体平台的推荐算法。

有声书试稿样章

一个独立作者写完 15 万字悬疑小说,想投给有声平台但没钱请专业主播试录。他需要一段 3 分钟的样章来展示故事节奏。用 piper 多音色分别合成「阴冷旁白」「急促对话」「老年角色独白」三个片段,再用剪辑软件拼成一条 demo。平台编辑听完后直接给了签约意向,因为样章证明了文本本身的声音表现力。

盲人家长读绘本

一位视障父亲想给 4 岁女儿读《好饿的毛毛虫》,但盲文绘本只有文字,没有语音点读功能。他把绘本每页文字逐句粘贴进工具,选中文童声音色,语速降到 0.85 倍,每句间隔手动加 0.3 秒静音。女儿听着合成音翻页,父亲在旁边摸盲文确认进度。这个流程让他每晚能独立完成 20 分钟的亲子共读,不再需要妻子代劳。

企业培训课件配音

一家物流公司要更新 40 页「分拣操作安全规范」PPT,原配音员工已离职,新招的兼职配音员报价每页 80 元且要排期一周。培训主管用本工具,选中文标准男声,把每页讲解词分段合成,导出后直接嵌入 PPT 自动播放。总耗时 45 分钟,成本为零,且后续修改操作流程时只需替换对应段落音频,不用重新约人录音。

第二节

使用指南

Getting Started

使用步骤

  1. 1在文本框中输入或粘贴要转换的句子,右侧预览区同步显示当前音色下的朗读效果
  2. 2从「语言」下拉框选择中文或英文,点击「试听」按钮播放单句样例,确认语音包已加载
  3. 3在「音色」列表点选不同角色(如男声/女声/童声),每次切换后预览区自动更新语音波形
  4. 4点击「生成音频」按钮,进度条走完后下方出现下载按钮,文件格式为 MP3

输入输出示例

输入输出说明
你好,世界。nǐ hǎo, shì jiè.常规:中文短句,验证中文拼音转换及标点处理。
Hello, world!hɛˈloʊ, wɜːld!常规:英文短句,验证英文音标输出及标点保留。
12345yī èr sān sì wǔ常规:纯数字,验证数字转中文读音。
(无输出)边界:空输入,验证工具对空字符串的处理(应返回空或提示)。
a边界:单个英文字母,验证单字母音标映射。
你好Hello世界123nǐ hǎo hɛˈloʊ shì jiè yī èr sān混合:中英文数字混排,验证多语种混合输入的处理能力。
𠮷𠮷𠮷jí jí jí易错:Unicode 扩展B区汉字(𠮷),验证非常用汉字的拼音映射是否完整。

常见错误对照

1.中文文本里混入了全角标点,导致合成停顿异常

✗ 错误今天天气真好。我们去公园吧!
✓ 修复今天天气真好。我们去公园吧!

Piper 和 eSpeak 的词边界检测依赖半角空格和半角标点。全角句号、感叹号会被当作字符本身处理,合成时可能产生非预期停顿或连读。

2.英文文本里数字没写完整,被读成单个数字

✗ 错误The year is 2025.
✓ 修复The year is two thousand twenty-five.

eSpeak 对数字默认按位读出(2-0-2-5)。要得到自然年份读法,必须将数字写成英文单词。Piper 多语言模型对此略有改善,但仍建议关键数字拼写。

3.中文英文混排时,没加空格导致英文单词被当拼音处理

✗ 错误请打开WIFI设置
✓ 修复请打开 WIFI 设置

Piper 中文模型遇到连续字母会尝试按拼音拼读。在中文与英文之间加空格,模型才能正确切换语言模式。

4.使用 eSpeak 时,中文文本里包含生僻字导致无声或错误发音

✗ 错误魑魅魍魉,四小鬼各自肚肠
✓ 修复魑魅魍魉,四小鬼各自肚肠(或替换为常见同音字)

eSpeak 中文词库仅覆盖约 6000 常用汉字,生僻字(如魑、魅、魍、魉)会直接跳过或发默认音。Piper 模型对此有改善,但建议关键内容用常见字。

5.英文缩写没加句点,被当单词读

✗ 错误NASA launched a rocket.
✓ 修复N.A.S.A. launched a rocket.

eSpeak 对连续大写字母默认按单词处理(读作“纳萨”)。加句点后引擎会逐字母读出。Piper 模型对常见缩写(NASA、FBI)有内置词典,但非常见缩写仍需加句点。

6.文本里包含 HTML 标签或 Markdown 语法,被当成文字念出来

✗ 错误请点击<b>这里</b>
✓ 修复请点击这里

TTS 引擎不解析标记语言,<b> 会被当作字符序列读出。合成前必须移除所有非文本标记。

7.中文文本里用了繁体字,合成音调异常

✗ 错误今天天氣真好
✓ 修复今天天气真好

Piper 中文模型主要基于简体字训练,繁体字映射到拼音时可能匹配错误声调。建议合成前将文本转为简体。

8.超长文本不切分,合成到一半卡死或输出截断

✗ 错误(一段 10000 字的文章直接粘贴)
✓ 修复(将长文本按段落或 2000 字以内分批合成)

Piper 和 eSpeak 均对单次输入长度有限制(通常 5000-8000 字符)。超长文本会导致浏览器内存溢出或后端超时。建议按自然段落分批处理。

第三节

工作原理

How It Works

核心公式

T = (L × 60) / (S × R)

变量说明

  • T合成音频时长,单位秒
  • L输入文本总字符数(含空格)
  • S语速倍率,1.0 为正常
  • R音色基准速率,单位字符/秒

示例

输入 120 个中文字符(含标点),语速设为 1.2 倍,Piper 中文音色基准速率约 8 字符/秒:T = (120 × 60) / (1.2 × 8) = 7200 / 9.6 = 750 秒(约 12.5 分钟)。

输入文本中文/英文/混合文本规范化数字/标点/缩写音素转换查字典/规则语音合成前端处理韵律/停顿预测声学模型piper/espeak音频输出并行处理
用户输入 本地处理 输出结果
第五节

常见问题

Q & A
这个文字转语音能不能把中文和英文混在一起读,比如一段话里既有中文又有英文单词?

可以。Piper 和 eSpeak 都支持中英文混合输入,但实现方式不同。Piper 的中文模型对英文单词(如“iPhone”“AI”)会尝试按英文发音读,而 eSpeak 需要手动指定语言标签(如 <lang=en>Hello</lang>)才能切换。如果发现英文单词被按拼音读,建议在英文单词前后加空格,或改用 Piper 的中英混合模型。本工具默认开启自动语言检测,但长段纯英文建议选英文音色。

为什么我输入 5000 字,生成的音频只有十几秒,是不是漏读了?

不是漏读,是默认语速偏快。Piper 和 eSpeak 的默认语速约 150-180 字/分钟,5000 字按此速度约需 1.5-2 分钟,但如果你选的音色是快速朗读型(如 eSpeak 的默认英文男声),实际可能更快。本工具界面有语速滑块(0.5x-2.0x),调低到 0.8x 可让语速接近日常说话节奏。另外注意:输入框下方显示的是字符数(含标点),不是实际朗读字数,中文字符一字一音但英文单词算多个字符。

Piper 和 eSpeak 出来的声音差别大吗,哪个更像真人?

差别很大。Piper 基于神经网络(VITS 架构),生成的语音接近真人,有语调起伏和自然停顿,尤其英文多音色模型(如“ljspeech”“libritts”)听起来像录音棚录的。eSpeak 是参数合成器(共振峰合成),声音机械感强,像早期导航语音,但优势是体积极小(几百 KB)且响应极快(毫秒级生成)。本工具默认用 Piper 模型,如果你对音质要求高选 Piper,对生成速度或离线部署有要求才选 eSpeak。

生成的音频能不能直接下载成 MP3?我试了下载是 WAV 格式。

本工具默认输出 WAV 格式(16kHz 采样率、16bit 单声道),因为 Piper 和 eSpeak 原生输出就是 WAV。如果你需要 MP3,可以在生成后使用本站在线音频转换工具(/yinpin/format)转码,或直接用本地播放器/剪辑软件转。注意:WAV 是无损格式,文件体积较大(1 分钟约 1.8MB),MP3 压缩后约 200KB,但音质差别不明显,因为 TTS 生成的语音本身频率范围有限。

我输入了 10000 个字,怎么点了生成后一直转圈不出结果?

Piper 模型在 CPU 上生成长文本时,处理时间与字符数成正比,10000 字约需 10-30 秒(取决于服务器负载和模型大小)。如果超过 1 分钟仍无结果,可能是输入包含特殊字符(如连续换行、Unicode 控制字符)导致模型解析卡住。建议分段输入(每段 2000-3000 字),或检查文本末尾是否有未闭合的引号/括号。本工具后端有超时保护(60 秒),超时会自动提示,无需刷新页面。

这个工具生成的语音能不能商用,比如放在我的视频或播客里?

可以商用,但需注意模型版权。Piper 使用的训练数据(如 LJ Speech、LibriTTS)均为 CC0 或公共领域,生成的语音无需署名,可自由用于商业项目(YouTube 视频、播客、有声书等)。eSpeak 是 GPL 协议,如果你直接用生成的音频文件而不用它的代码,同样不触发 GPL 传染(类似用 GIMP 导出的图片)。本工具不额外附加协议,生成的音频归用户所有。但建议不要用名人声音模型(如果有)做音色模仿,以免肖像权风险。

为什么同一个文本,我换了音色后生成的语音长度不一样?

不同音色的语速基准不同。Piper 的多音色模型(如“ljspeech”女声、“libritts”男声)在训练时用了不同语速的录音数据,即使本工具设置了相同的语速滑块(如 1.0x),实际朗读速度仍可能有 10%-20% 差异。另外有些音色(如“vctk”系列)包含不同说话人的发音习惯(喜欢拖长音或连读),也会影响总时长。如果需要精确控制时长,建议先用短文本测试选定音色,再批量生成。

我输入了带数字的句子,比如“今天是 2025 年 3 月 15 日”,它读成“二零二五年三月十五日”还是“两千零二十五年”?

取决于你用的模型。Piper 的中文模型(基于中文 TTS 数据集)对常见日期格式(YYYY年MM月DD日)会按“二零二五年三月十五日”朗读,符合日常习惯。但如果是纯数字串(如“2025”单独出现),Piper 会读成“两千零二十五”(少数模型)或“二零二五”(多数模型)。eSpeak 中文模式则统一按数字逐个读(“二 零 二 五”),不识别日期格式。建议对日期、电话号码等特定格式,在输入时用汉字写(“二〇二五年三月十五日”)以获得最准确读音。

隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。

选择 打开 +新窗口 esc关闭