首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
edge-tts:免费调用微软在线文本转语音,一条命令产出 mp3 与 SRT 字幕
📅 2026/9/14 22:21:38
✍️ 爱科研究院
👁 阅读 3,247
edge-tts免费调用微软在线文本转语音一条命令产出 mp3 与 SRT 字幕【免费下载链接】edge-ttsUse Microsoft Edges online text-to-speech service from Python WITHOUT needing Microsoft Edge or Windows or an API key项目地址: https://gitcode.com/GitHub_Trending/ed/edge-ttsedge-tts 是一个 Python 库用来调用微软 Edge 浏览器背后的在线文本转语音TTS服务。它不需要 API 密钥、不需要 Windows、不需要安装 Edgepip 装完就能把文本合成 mp3 音频并同时产出带时间轴的 SRT 字幕。调用直接打到微软的在线接口使用者零费用。三个现成场景有声书与朗读把长文本喂进去得到 mp3 和逐句对齐的字幕可直接给读屏软件或视频挂字幕。视频配音语音列表覆盖中、英、法、阿拉伯语等数十种语言每种语言有多个男女声按语言批量生成配音片段。智能家居与应用集成官方 README 里列了 Home Assistant 的 hass-edge-tts 插件作为集成案例说明它适合挂进长期运行的服务里。安装并生成第一条语音pip install edge-tts一行命令生成音频和字幕edge-tts --text 你好世界 --write-media hello.mp3 --write-subtitles hello.srt只想要命令行版本的话用pipx install edge-tts更合适不会污染系统 Python 环境。不指定--voice时默认使用en-US-EmmaMultilingualNeural。动手前先看看有哪些可选声音edge-tts --list-voices输出是四列表格名称、性别、适用内容类别、声音性格。挑一个名字传给--voice即可。用三个参数微调语速、音量、音调--rate、--volume、--pitch分别对应语速、音量、音调单位是百分比和赫兹。负值要紧跟等号写否则 shell 会把-50%当成另一个参数edge-tts --rate-50% --volume20% --pitch-50Hz --text 演示 --write-media demo.mp3输入端除了--text还有--file从文件读文本-表示从标准输入--proxy可给语音列表和合成请求走代理。自定义 SSML 已被移除服务端只接受 Edge 浏览器自己生成的 SSML而 prosody 里能调的项都被上面三个参数覆盖了不需要绕路。字幕与实时播放SRT 来自合成过程中服务回传的 WordBoundary / SentenceBoundary 边界事件由 SubMaker 拼成字幕行时间戳按实际收到的音频字节数校准长文本不会逐渐漂移。另一个edge-playback命令直接调用本地播放器出声不落盘。注意它在非 Windows 平台要先装 mpv且不支持--write-media、--write-subtitles、--list-voices这三个选项。Python 代码里几行就够把文本转语音接进代码同步写法只要两行完整用法见 examples/ 里的六个官方示例communicate edge_tts.Communicate(text, zh-CN-XiaoxiaoNeural) communicate.save_sync(out.mp3)异步环境改用await communicate.save(...)要在代码里出自幕把边界事件喂给edge_tts.SubMaker()后调get_srt()即可。想按属性动态选声音VoicesManager 可以按语言、性别、区域筛选voices await VoicesManager.create()拿到后再用voices.find(GenderFemale, Localezh-CN)筛出候选语音。⚠️ 几个容易踩的细节依赖在线服务合成走微软在线接口网络不稳时建议在代码里加重试连接超时和读超时在Communicate构造函数里可配默认 10 秒和 60 秒。长文本自动分段超长输入内部按 4096 字节自动切块优先在句界、词界处断并避开多字节字符和 XML 实体中间不需要自己分段。403 会自动恢复服务端用一个由浏览器版本和本地时间生成的 token 校验请求失效时 drm.py 会纠正时钟偏移后自动重连。音频规格固定输出是 24kHz、48kbps 的单声道 mp3做朗读绰绰有余别把它当音乐级音源用。源码结构一个 WebSocket 客户端加几个小工具核心逻辑是 communicate.py 里的 WebSocket 客户端连上合成接口、发送 SSML、流式收音频与边界事件其余文件都是围绕它的小工具。edge-tts/ ├── examples/ # 六个官方示例同步/异步、流式、字幕、动态选声 ├── src/edge_tts/ │ ├── communicate.py # 核心WebSocket 通信、长文分段、音频与边界事件解析 │ ├── voices.py # 拉取语音列表按语言/性别筛选 │ ├── submaker.py # 边界事件转 SRT 字幕 │ └── drm.py # 请求 token 生成与时钟偏移纠正 ├── src/edge_playback/ # edge-playback 命令调本地播放器实时出声 └── tests/ # 长文本回归测试脚本先装好跑一遍第一条命令听听 hello.mp3想深入就读communicate.py的stream()方法。源码可用git clone https://gitcode.com/GitHub_Trending/ed/edge-tts获取。【免费下载链接】edge-ttsUse Microsoft Edges online text-to-speech service from Python WITHOUT needing Microsoft Edge or Windows or an API key项目地址: https://gitcode.com/GitHub_Trending/ed/edge-tts创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/14 22:21:38
Klipper故障排查:四步定位从现象到根因
2026/9/14 22:16:37
Shopify 重回原生:AI 改写了跨端框架的成本公式
2026/9/14 22:16:37
基于matlab阈值分割的车牌识别系统【源码75期】
2026/9/14 22:51:41
电力设计院AI选型:单工具还是闭环?决策框架与落地策略
2026/9/14 22:51:41
钢网开口不对、少锡连锡?SMT贴片加工厂印刷怎么调
2026/9/14 22:51:41
NaaS技术原理拆解:从SD-WAN到网络即服务,底层发生了什么
2026/9/14 22:51:41
从AI焦虑到工程落地:技术人如何用大模型与Agent构建护城河
2026/9/14 22:51:41
中考英语语法真题2000+刷题实操复盘:从平台选型到稳步提分
2026/9/14 22:46:41
Transformers.js 安装指南:从 NPM 到 CDN 的完整接入方案
2026/9/14 0:03:40
KCF目标跟踪算法与OTB工程实现:毕业设计实战解析
2026/9/14 0:03:40
Megatron-LM 推理实战指南:基于 Megatron Core 高层 API 的离线推理与 OpenAI 兼容服务
2026/9/14 0:03:40
语音情感识别实战:Keras实现LSTM、CNN、SVM与MLP多模型对比
2026/9/14 7:37:16
拯救者Y7000黑屏故障排查与维修实战指南
2026/9/14 2:50:57
AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
2026/9/14 11:25:37
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化