首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
MLX-Audio 实战:2 条命令跑通 Mac 上的本地语音合成
📅 2026/9/20 1:28:52
✍️ 爱科研究院
👁 阅读 3,247
MLX-Audio 实战2 条命令跑通 Mac 上的本地语音合成【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio想在 Mac 上跑文本转语音或语音识别通常只有两个不理想的选项云 API 按量计费、音频要离开本机CUDA-only 的本地开源模型在 Apple Silicon 上又跑不起来。MLX-Audio 把主流语音模型搬到 MLX 上文本转语音、语音识别、语音转换都能在 M 系芯片上本地运行不依赖 NVIDIA 显卡。为什么在 Apple Silicon 上本地跑语音模型它的差异不在模型本身而在运行时。Whisper large-v3-turbo 覆盖 99 语言转写可以直接在本机完成Kokoro 只有 82M 参数、54 个预置音色、8 种语言8GB 统一内存的老 M1 也能从容加载。更实际的好处是量化支持 3、4、6、8 bit 以及 mxfp44bit 体积约为 fp16 的 1/4。比如 7B 的 KugelAudio 在 bf16 下需要约 17GB 内存换成低精度 checkpoint 占用直接减半——M 系机器统一内存紧张这决定了大模型能不能跑得动。2 条命令拿到第一段音频安装是一行命令按能力装 extra只装 tts 不会拉进 STT 依赖pip install mlx-audio[tts]然后生成第一段语音。这个例子用的是 8bit 量化的 0.6B Qwen3-TTS模型首次运行会自动下载生成的 wav 落在当前目录mlx_audio.tts.generate \ --model mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit \ --text Hello, world! --voice Vivian加--play可以直接听。Python 侧同样轻量mlx_audio.tts.utils里的load_model传入模型 ID迭代generate就能拿到波形细节见 Python 快速上手。常见的 3 种用法批量音频生产。最有说服力的证据在仓库示例里examples/bible-audiobook/ 调用本地 API 服务把 31,102 节经文逐句转成 86 小时的音频作者用一台 24GB 的 M4 Pro Mac mini 跑了 28 小时。做整书配音、课程音频这类活儿这是可以照抄的工程样板。音频转文字。Whisper 覆盖 99 语言VibeVoice-ASR 支持最长 60 分钟的录音输出带说话人分离和时间戳也支持流式输出。会议纪要、字幕制作这类场景整条链路可以留在本机。接入现有服务。mlx_audio.server起一个 OpenAI 兼容的 REST API/v1/audio/speech和/v1/audio/transcriptions与官方接口对齐已经在用 OpenAI SDK 的代码基本改个 base URL 就能切过来。下一步从试用到真正用起来先翻 Python 快速上手 过一遍各模型的调用方式内存小的机器看 量化指南优先挑 4bit 的 checkpoint。要输出 MP3 需要 ffmpeg只出 WAV 可以跳过。建议第一次先挑一个小模型生成三句话听一下音质再决定往哪个方向深入。【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/20 1:28:52
VMware安装ESD镜像:ESD转ISO全流程与虚拟机部署指南
2026/9/20 1:28:52
昇思MindSpore全场景AI开发实战:从环境搭建到端侧部署的成长指南
2026/9/20 1:28:52
红外与可见光图像融合数据集:从配准到YOLOv8实战全解析
2026/9/20 2:23:54
PyTorch Lightning 1.5 到 2.0 升级完整指南:从 Trainer 参数重构到 Strategy 架构迁移
2026/9/20 2:23:54
AI基础层核心三要素:算力、算法与数据的工程化落地指南
2026/9/20 2:23:54
AI行业高薪岗位解析与就业趋势
2026/9/20 2:23:54
把 Hermes Agent 的模型接口地址改到 TaoToken 通道后,hermes setup 一次通过
2026/9/20 2:23:54
句子嵌入与RAG架构:生成式AI的高效实践
2026/9/20 2:18:54
树莓派4实战:智能坐垫物联网项目从选型到远程监控
2026/9/20 0:03:47
深入解析Transformer多头注意力机制与工程优化
2026/9/20 0:03:47
OpenClaw 的 Skills 跑学习任务,模型通道改到 TaoToken 通道行不行?
2026/9/20 0:03:47
ChatGPT报错Oops, an error occurred! 全链路排查指南
2026/9/20 0:03:47
深入解析Transformer多头注意力机制与工程优化
2026/9/20 0:03:47
OpenClaw 的 Skills 跑学习任务,模型通道改到 TaoToken 通道行不行?
2026/9/20 0:03:47
ChatGPT报错Oops, an error occurred! 全链路排查指南