NeMo Speech 模型选型指南为你的语音任务挑选正确的预训练模型【免费下载链接】SpeechA scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)项目地址: https://gitcode.com/GitHub_Trending/nem/SpeechNeMo Speech 提供了大量预训练语音模型覆盖自动语音识别ASR、语音合成TTS、说话人任务语者分离/识别/活动检测与语音大语言模型SpeechLM四大领域。本文以仓库 docs/source/starthere/choosing_a_model.rst 为骨架逐条解读官方推荐的模型选型依据并深入仓库源码与配套文档帮助你根据自己的应用场景实时流式转写、多语言翻译、边缘部署、会议多说话人转写、语音克隆等快速锁定最合适的模型掌握模型的获取渠道与加载方式。先读懂模型命名中的关键术语选型之前先掌握 ASR 模型检查点列表 中定义的一组核心术语它们决定了模型的能力边界术语含义对选型的影响AEDAttention Encoder-Decoder基于交叉注意力的自回归解码器Canary 家族采用支持多任务输出CTCConnectionist Temporal Classification非自回归解码器解码快、管线简单适合外接语言模型RNN-TRecurrent Neural Network Transducer自回归、流式友好的解码器支持流式推理延迟可控TDTToken-and-Duration Transducer在 RNN-T 基础上引入时长预测推理速度更快Parakeet-TDT 系列采用HybridRNN-T CTC 联合训练的双解码器模型推理时二者可任选其一PnCPunctuation and Capitalization输出带标点与大小写直接产出可读文本SALMSpeech Augmented Language Model语音编码器 大语言模型支持转写、翻译与音频问答Streaming实时 / cache-aware 推理能力低延迟场景必备EU4 / EU25支持 4 种英德西法/ 25 种欧洲语言多语言覆盖范围其中FastConformer是 NeMo Speech 的默认 ASR 编码器8× 降采样与优化注意力Parakeet、Nemotron Speech 与stt_*_fastconformer_*系列共享同一底层 FastConformer 编码器名称差异只是发布品牌不同并非架构差异——这一点在 docs/source/asr/asr_checkpoints.rst 中有明确说明。ASR该选哪个模型原文档用一张我想做什么 → 推荐模型 → 为什么的决策表回答了这个高频问题完整继承如下我想做什么推荐模型为什么在英语上获得最佳准确率Canary-Qwen 2.5B英语 ASR 的 SOTA 水平若需要极快的离线替代方案且接近 SOTA 准确率可用 Parakeet-TDT V2 或 Parakeet-TDT V3转写多种语言Canary-1B V2支持 25 种欧盟语言及其互相翻译AED 解码器转写欧洲语言仅 ASR自动语种检测Parakeet-TDT 0.6B V3单模型覆盖 25 种欧洲语言自动语种检测支持标点/大小写与词级/片段级时间戳提供长音频与流式选项不含语音翻译需要翻译请用 Canary-1B V2实时流式转写音频Nemotron-3.5-ASR-Streaming40 种语言的低延迟流式 ASR延迟可调80ms–1schunk 大小可配置基于 Cache-aware FastConformer最小化模型体积Canary-180M Flash体积最小的多语言模型适合边缘部署使用 CTC 解码更简单的管线Parakeet-CTC-1.1B非自回归、速度快适合外接语言模型集成外部语言模型任意 Parakeet 模型 NGPU-LMGPU 加速的 n-gram LM 融合支持 CTC、RNN-T 与 TDT 模型转写多说话人会议Multitalker Parakeet Streaming实时处理重叠语音带说话人自适应解码逐条深挖这些推荐背后的能力差异追求英语最高准确率 → Canary-Qwen 2.5B。它属于 Canary 家族中的 SALM 形态在 docs/source/asr/asr_checkpoints.rst 中标注为 SALM 解码器将语音编码器与大语言模型结合除 ASR 外还具备 AST、PnC 与时间戳能力。快速替代方案 Parakeet-TDT V2 / V3 则是 TDT 解码器在保持接近 SOTA 准确率的同时显著提升推理速度。多语言与欧洲语言转写 → Canary-1B V2 与 Parakeet-TDT 0.6B V3。二者的分界很清晰Canary-1B V2 是 AED 解码器覆盖 EU25 并支持语音到语音的翻译Parakeet-TDT 0.6B V3 只做 ASR但附加了自动语种检测、PnC 与时间戳。注意 ASR 检查点列表 中 parakeet-tdt-0.6b-v3 的语言列为 English原文档对其多语言能力的描述以官方模型卡为准——这提示我们在生产选型时要以目标模型的 HuggingFace 模型卡标注为最终依据。实时流式 → Nemotron-3.5-ASR-Streaming。它是 Cache-aware FastConformer 架构40 种语言延迟可在 80ms–1s 范围内调节chunk 大小可配置。在 ASR 检查点列表 的 Streaming Models 一节中stt_en_fastconformer_hybrid_medium_streaming_80ms_pc、stt_en_fastconformer_hybrid_large_streaming_multi多 look-ahead等模型同样属于流式阵营适合对延迟有不同要求的场景。边缘部署 → Canary-180M Flash。180M 参数量的多语言模型EU4 语言是 Canary 家族中体积最小的成员Flash 后缀表明针对推理速度做了优化。简化管线 / 外接 LM → Parakeet-CTC-1.1B 与 NGPU-LM。CTC 解码器非自回归、速度快天然适合与外部语言模型协作。NGPU-LM 是 GPU 加速的 n-gram LM 融合工具在仓库中对应 tests/collections/asr/test_ngram_lm.py 等测试覆盖支持对 CTC、RNN-T、TDT 三类模型的解码结果进行 LM 重打分。多说话人会议 → Multitalker Parakeet Streaming。这是仓库中流式多说话人 ASR 的代表对应测试 tests/collections/asr/test_asr_multitalker_models.py 验证了其推理与解码链路可实时处理重叠语音并使用说话人自适应解码输出各说话人的转写。TTS该选哪个模型我想做什么推荐模型为什么生成高质量多语言语音MagpieTTS端到端、基于 LLM 的 TTS支持声音克隆与多语言快速、可控的英语合成FastPitch HiFi-GAN级联管线支持音高/时长控制久经测试生成离散音频 tokenAudio Codec神经音频编解码器用于将音频 token 化MagpieTTS 内部使用MagpieTTS 是仓库 TTS 集合中的核心模型类 MagpieTTSModel多语言 357M 版本可通过MagpieTTSModel.from_pretrained(nvidia/magpie_tts_multilingual_357m)加载其do_tts(transcript..., language...)接口在 五分钟快速上手 中有完整示例可直接生成 22050Hz 采样率的 WAV 文件。其底层依赖的离散音频 token 由 AudioCodecModel 提供该模型同时可用于独立的音频编解码任务对应 Audio Codec 训练/推理教程。FastPitch HiFi-GAN 则是经典的两段式级联管线FastPitch 负责从文本预测音高、时长等声学参数HiFi-GAN 将声学特征重建成波形。其优势在于对音高、语速等要素的显式控制相关训练/微调脚本见 examples/tts/fastpitch.py 与 examples/tts/hifigan.py。Speaker Tasks该选哪个模型我想做什么推荐模型为什么确定谁在什么时候说话Streaming Sortformer、Offline Sortformer端到端语者分离最多 4 个说话人实时场景用流式版批处理用离线版验证 / 识别说话人TitaNet提取说话人 embedding用于验证与识别检测语音活动MarbleNet帧级 VAD多语言可作预处理步骤Sortformer 系列在仓库中的实现是 SortformerEncLabelModel从源码结构看它继承自ModelPT并混入ExportableEncDecModel与SpkDiarizationMixin既可用于端到端训练推理也可导出部署。对应测试见 tests/collections/speaker_tasks/test_diar_sortformer_models.py。快速上手示例中通过SortformerEncLabelModel.from_pretrained(nvidia/diar_streaming_sortformer_4spk-v2)加载调用diarize(audio[...])即可返回(开始秒, 结束秒, 说话人索引)的分段结果详见 docs/source/starthere/ten_minutes.rst。TitaNet 用于说话人识别/验证产出固定维度的说话人 embeddingMarbleNet 则是帧级多语言 VAD常作为长音频切分、语者分离等任务的前置预处理模块。更完整的任务介绍见 说话人分离与识别文档。Speech Language Models该选哪个模型我想做什么推荐模型为什么就音频内容提问Canary-Qwen 2.5BSALM以 LLM 增强语音理解可转写、翻译并回答关于音频的问题构建语音到语音系统DuplexS2SModel全双工模型既能理解语音也能生成语音SALMSpeech Augmented Language Model在仓库中对应 SALM 类基于LightningModule与HFHubMixin加载与生成示例见 docs/source/starthere/ten_minutes.rstSALM.from_pretrained(nvidia/canary-qwen-2.5b)后通过model.generate(prompts[[{role: user, content: ..., audio: [...]}]], max_new_tokens...)交互audio_locator_tag作为音频占位符注入提示词。其 ASR 解码链路由 SALMWithAsrDecoder 支撑相关测试见 tests/collections/speechlm2/test_salm_asr_decoder.py。DuplexS2SModel 属于全双工语音对话模型位于 SpeechLM2 集合见 docs/source/speechlm2 相关文档与 examples/speechlm2 下的训练/推理脚本可同时接收并生成语音适合构建实时语音对话系统。模型从哪里获取所有 NeMo Speech 预训练模型均通过以下渠道发布HuggingFace Hubnvidia 组织——搜索 nemo 或具体模型名即可找到对应模型卡模型卡中附有基准测试分数NGC Model Catalog——NVIDIA 的模型注册中心可按权重流行度排序检索社区精选检查点——外部用户基于官方模型微调后贡献的检查点见 Featured Community Checkpoints。如何加载与验证模型检查点格式NeMo Speech 模型主要以.nemo格式发布它是一种 tar 归档打包了模型配置YAML、权重.ckpt与 tokenizer 等工件。标准 tar 工具即可解包、修改、重新打包便于检查配置或替换 tokenizer详见 检查点格式说明。此外SpeechLM2 系列模型遵循 HuggingFace 惯例使用.safetensors格式并通过save_pretrained/from_pretrained保存与加载大规模并行训练时 PyTorch Lightning 还会生成分布式检查点目录。加载代码import nemo.collections.asr as nemo_asr # 从预训练模型加载自动从 HuggingFace/NGC 下载 model nemo_asr.models.ASRModel.from_pretrained(nvidia/parakeet-tdt-0.6b-v2) # 从本地 .nemo 文件加载 model nemo_asr.models.ASRModel.restore_from(path/to/model.nemo)命令行快速转写python examples/asr/transcribe_speech.py \ pretrained_namenvidia/parakeet-tdt-0.6b-v2 \ audio_dir./my_audio_files/测试与示例佐证仓库中为上述模型家族提供了覆盖性测试与现成示例可作为选型后的验证入口流式多说话人 ASRtests/collections/asr/test_asr_multitalker_models.pySortformer 语者分离tests/collections/speaker_tasks/test_diar_sortformer_models.pySALM 语音问答解码tests/collections/speechlm2/test_salm_asr_decoder.py端到端模型下载与推理冒烟测试如 L2_Model_Support_nvidia__parakeet_tdt_0_6b_v2.sh、L2_Model_Support_nvidia__magpie_tts_multilingual_357m.sh、L2_Model_Support_nvidia__diar_sortformer_4spk_v1.sh选型决策速查纯离线、追求英文最高准确率→ Canary-Qwen 2.5B或追求速度用 Parakeet-TDT V2/V3多语言转写 翻译→ Canary-1B V2EU25AED多语言转写不需要翻译要标点/时间戳→ Parakeet-TDT 0.6B V3实时低延迟流式→ Nemotron-3.5-ASR-Streaming40 语言延迟 80ms–1s 可调边缘设备、体积敏感→ Canary-180M Flash要外接 n-gram 语言模型→ 任意 ParakeetCTC/RNN-T/TDT NGPU-LM多说话人重叠语音实时转写→ Multitalker Parakeet Streaming高质量多语言语音合成→ MagpieTTS需要离散音频 token 时配合 Audio Codec快速可控英语合成 → FastPitch HiFi-GAN谁在何时说话→ Sortformer流式/离线说话人验证识别 → TitaNet语音活动检测 → MarbleNet对音频内容提问 / 语音到语音对话→ Canary-Qwen 2.5BSALM/ DuplexS2SModel。如果希望更系统地理解这些模型背后的音频约定、编码器架构Transformer / Conformer / FastConformer与 YAML 配置结构可继续阅读 语音 AI 关键概念想直接用 50 行代码体验转写、合成、语者分离与语音问答的完整流程可参考 NeMo Speech 五分钟快速上手。【免费下载链接】SpeechA scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)项目地址: https://gitcode.com/GitHub_Trending/nem/Speech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考