首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
智转AI V8.4:从说话人分离到大模型结构化提取的会议纪要工程实践
📅 2026/10/1 9:22:39
✍️ 爱科研究院
👁 阅读 3,247
说实话接到“智转AI V8.4 公测上线”这个版本任务的时候我心里是有几分忐忑的。AI写纪要这功能市面上已经不算新鲜前几版我们也尝试过不少方案但一直有几个绕不过去的坎录音转写完内容堆了一大片、重点不突出、说话人分不清、生成结果还得人工大改改完的工作量不比手写少多少。这次V8.4我们相当于把整个链路重新梳理了一遍从语音识别、说话人分离到大模型摘要、结构化输出每一环都换了思路。这篇文章就把这轮打磨过程里的技术取舍、实测数据和踩坑经验完整记录下来给正在做AI纪要产品、或者想用AI把会议提效真正落地的朋友一个参考。整个版本的研发周期前后花了两个多月公测期间我们内部跑了三百多场真实会议覆盖产品评审、项目周会、客户对接、技术方案评审甚至法务合同讨论累计处理了超过两千小时的会议录音。最终收敛出来的效果我自己比较满意的点在于V8.4不再是简单地把“录音转成文字再塞给大模型”而是真正按照人类会议记录员的思维方式重构了整套处理流程。这篇博客我会从需求拆解、方案设计、实操细节、问题排查几个维度展开尽量把可复现的经验都写清楚。1. 项目背景与需求拆解为什么纪要这么难写1.1 会议纪要的普遍痛点转写≠纪要先说一个最基本的认知语音转写和会议纪要根本是两件不同难度的事情。很多AI工具做纪要说到底只是把录音转成文字再生成一个自动摘要。但实际工作中一份合格的纪要至少要解决三件事这场会议讨论了什么、谁说了什么关键内容、最后决定了什么以及谁去执行。这个需求看起来直白真正落到技术方案上却非常麻烦。以我们拿到的真实用户反馈为例过去用户吐槽最多的是三点第一转写出来的文字没有分段逻辑五十分钟的会产出一万字以上文字稿看着就头大第二AI摘要喜欢“平均用力”把大家寒暄和重复讨论的话也当成重点真正的结论反而被淹没第三涉及多个部门协作的会议经常出现“内容都对但不知道是谁拍板定的方案”的情况责任归属不清晰后续根本没法跟进。1.2 V8.4的产品定位做“会议记录员”而不是“转写机”基于这些反馈我们在V8.4立项时明确了一个核心原则智转AI的角色应该是“一个训练有素的会议记录员”而不是单纯的“转写机器”。会议记录员会怎么做他会先听完整个讨论在脑子里理出主线区分哪些是背景陈述、哪些是意见交锋、哪些是最终结论然后按照“结论先行、论据随后、待办收尾”的结构输出纪要。这个定位变化直接决定了V8.4的技术架构。我们不再强调“逐字稿的忠实度”而是重点优化“信息结构化的准确度”。翻译成人话就是宁可丢掉一部分重复的口水话也要保证每个观点、每条结论、每项待办是拎得清的。这个取舍在公测用户调研里得到正面反馈——超过70%的内测用户认为V8.4产出的纪要“可以直接作为工作存档使用”而前代版本这个比例只有不到40%。1.3 目标用户与应用场景V8.4主要面向三类用户。第一类是管理者他们每天要开大量决策会需要的是半小时内能扫完的结论摘要第二类是项目经理他们最关心讨论中的风险点和待办分配需要纪要像任务清单一样清楚第三类是客服质检、律师、顾问这类需要沉淀沟通记录的从业者他们需要的是“过程可回溯”要能快速定位到某句话在录音的哪个时间点。这三类用户对纪要的需求侧重点差异很大单纯靠一个摘要模板根本不可能全满足。所以V8.4在输出端做了分层——完整逐字稿、结构化纪要、极简要点三种视图随意切换底层是同一套结构化数据只是展示层面做了取舍。这个设计后面在实操部分我会详细讲它算是这次版本最值得参考的产品思路之一。2. 核心算法与方案设计AI纪要的底层逻辑2.1 语音转写与说话人分离先解决“谁说的”问题任何纪要功能的地基都是语音转写。但这轮我们重点投入的不是转写准确率本身因为通用语音识别模型在中英文普通话场景下已经足够成熟真正影响纪要质量的瓶颈是“谁在什么时候说了什么”——也就是说话人分离Speaker Diarization)技术。前代版本用的是纯声纹聚类方案先按声音特征把不同说话人分开再打上“说话人1、说话人2”的标签。这套方案在安静环境下效果尚可但在真实会议室里经常翻车——有人中途离场、有人隔着桌子喊话、还有人感冒嗓子哑了声纹特征一变聚类结果就乱套了。最终纪要里经常出现“说话人3突然插了一句结论”搞得读者根本不知道是谁拍板的。V8.4换成了“声纹特征语义角色”融合方案。具体做法是先用声纹聚类分出候选说话人再用大模型根据语义内容去推断角色身份——比如“这个声音一直在问风险、成本和排期且发言内容多为追问推测是项目经理”。用会议室里的常见角色主持人、决策者、执行人、陈述人打上语义标签再映射到实际人员名单。实测下来标准四人会议的角色识别准确率从73%提升到了91%多人大型评审会的可用性也明显改善。这个思路没有太高门槛但确实是我们这轮最值得的一笔投入。2.2 大模型结构化整理流程从“摘要”到“结构化提取”上一代V8.0左右的版本我们用的是“全文转写加一段式摘要”的套路提示词也不复杂大概就是“请总结以下会议内容的重点”。这种办法生成的东西其实就是把会议内容“压缩”了一遍重点词没丢但逻辑结构完全不存在——更像是把流水账改短了一点谈不上纪要。V8.4把单次生成改成了三段式流水线。第一步先让大模型把逐字稿拆分为“讨论主题块”每个主题块自动命名比如“预算审批流程优化”“客户A续约合同条款”。第二步针对每个主题块分别提取四类信息背景描述、关键观点、结论决议、争议焦点。第三步再把所有主题块的结论横向汇总生成统一的待办事项表并标注负责人、截止时间如果原文有提到、关联主题。这个流水线设计的好处非常明显大模型每一步的任务变简单了准确率自然提高而且中间结果都是可追溯的。如果用户觉得某个主题块提取有问题可以直接单独修正那一块不会像单次生成那样“牵一发动全身”改一处引发全文重写。代价是整体生成时间从过去的20秒左右延长到了40-60秒为了质量这步我们认为是值得的。2.3 提示词工程与参数调优四个关键细节在提示词方面我们踩了不少坑这里分享四个直接影响最终质量的细节。第一不要用“请总结会议纪要”这种笼统说法一定要给模型明确的结构模板和字段定义。我们最终固定了一套模板每个主题块下面固定有“结论/背景/分歧/待办”四个子项说清每个子项的输出规范——比如“结论只能写会上明确达成共识的内容不要推测”。第二上下文窗口管理要精细。一场两小时的会议逐字稿可能有四五万字超出大模型单次处理上限我们选择用滑动窗口按主题块切分而不是简单粗暴地截断前几千字。切分时还保留了相邻段落的重叠避免话题在边界处被切断。第三温度参数要调低基本保持在0.2以下甚至可以直接接近0。纪要不是创作需要克制和稳定温度一高模型就容易自己“脑补”把会上根本没说的话写进纪要里这是很严重的事故。第四语气和视角统一。提示词里明确一句“以记录者的客观口吻输出不评价任何发言内容”能明显降低模型穿插主观判断的概率。有一版模型特别喜欢在结尾加“整体讨论顺利建议各方持续推进”这种废话改掉提示词之后这类输出基本消失了。2.4 模型选型与成本控制关于底层模型V8.4公测版在长文本理解任务上选择了百亿到千亿参数级别的开源模型做微调底座。选择开源模型而不是纯闭源API主要是从数据安全和成本两个角度考虑。企业会议录音往往涉及商业敏感信息能私有化部署是很强的卖点这一点在面向B端客户时格外重要。成本方面我们在全套流程中引入了“分级调用”策略角色识别和语音处理这些小而高频的任务用小模型主题分块和结构化提取用大模型最后的信息聚合和语言润色用最强模型。分摊下来单场一小时会议的全套AI处理成本控制在几角钱量级对产品商业化来说是一个可以接受的数字。3. 实操演示用智转AI V8.4生成一份会议纪要3.1 完整使用流程从录音到三视图V8.4的使用流程分成四步导入音频、选择会议类型、等待AI处理、查看并导出纪要。第一步支持直接上传本地录音文件、导入外部会议软件录制好的音视频也可以在App内直接开启实时录音转写。第二步是这版新增的需要用户先选择会议类型目前有项目周会、产品评审、客户洽谈、技术方案讨论、通用会议五类这个选择会直接影响后面主题分块和角色识别的参数配置。第三步AI处理过程中界面会实时显示处理进度先显示“转写中”再显示“识别说话人”然后是“分析主题结构”最后是“生成会议纪要”。这不仅仅是动画效果实际每一阶段都是独立任务任何一个阶段失败都可以单独重试不用整个流程从头跑。第四步输出阶段V8.4默认展示的是“结构化纪要”视图顶部是会议概况时间、时长、参会人、会议类型紧接着是“核心结论”列表再往下是按主题分块的详细讨论记录最后是待办事项表。右上角可以一键切换到“极简要点”或“完整逐字稿”切换是瞬时的。文件中所有引用性内容都带时间戳点一下就能跳转到对应录音位置这个功能实测在回溯核对时超级好用。3.2 参数选择与自定义模板虽然V8.4提供了默认参数但实际使用中自定义能力直接决定了用户是否“黏住”这个产品。在设置里可以调整三类核心参数。第一类是详略程度有三个档位精简每主题块仅保留结论和关键待办、标准增加背景和主要观点、详尽保留分歧细节和完整论据链。第二类是角色映射开关如果用户上传了参会人员名单可以手动将声纹ID对应到具体人名修正准确率能进一步提升。第三类是自定义模板入口用户可以把公司内部的纪要格式保存为模板比如有的公司规定纪要必须包含“上期遗留问题完成情况”有的团队要求标注每个决策的反对意见——模板功能允许用户直接定义输出结构模型会严格按这个结构填充内容。参数选择界面我都建议配置完跑一条小样验证一下别直接在大会议录音上试错。公测中我们发现用户往往低估“会议类型”这个参数的影响——同样一段销售例会录音选“客户洽谈”和选“项目周会”输出的侧重点完全不同。前者会更关注报价、条款、客户异议后者会偏重进度、风险和排期。3.3 V8.4效果实测真正“可用”的转折点直接放一组我们在公测期间的对比数据。我们组织了十位志愿者分别用V8.4和某主流在线会议软件的AI纪要功能处理同一批五场会议录音由五位独立评审从“结论完整度”“逻辑结构”“待办可执行性”“语言通顺度”四个维度打分单项满分10分。评估维度V8.4平均分竞品平均分差异说明结论完整度8.67.1V8.4能识别隐性结论竞品更多是复述原话逻辑结构8.96.4竞品偏流水账V8.4按主题块组织待办可执行性8.45.2竞品经常漏掉责任人V8.4会结合上下文推断语言通顺度8.28.0双方相差不大转写质量两者都成熟其中最直观的差异在“待办可执行性”。竞品处理后的待办经常是“后续跟进一下供应商的事情”这种话V8.4则会结合上下文补全成“张三负责在周五前与供应商确认交期并将结果同步给项目组”。甚至在原会议中没人明确说“张三负责”时模型能根据“这个事得供应链那边推动”“张三在供应链组”这样的蛛丝马迹进行推断再在待办表里标注“推断责任人待核实”。这种处理方式让纪要的可用性上了一个台阶。3.4 一个真实案例的完整输出对照为了更具体地展示效果我从公测语音库中抽出一段简短模拟会议做展示。原始会议内容大意是产品经理A提出新用户引导流程改版开发B说排期紧张设计C担心素材不足最后负责人D拍板先做简化版两周内上线A牵头C本周出图B协调一名开发支援。前代产品输出的纪要大概长这样“讨论了新用户引导流程改版问题开发资源紧张设计素材不足决定先做简化版两周内上线相关人员配合执行。”——信息全在但责任人不明时限也是模糊的。V8.4输出结构如下核心结论新用户引导流程改版采用简化方案目标两周内上线由A产品经理牵头推进。分主题讨论——改版方案背景现有引导流程步骤多新用户流失率高A提出改版需求。观点B反馈当前开发排期已满需协调资源C提出缺少引导页素材需优先补充。结论先上线简化版不做复杂动效聚焦核心注册路径。待办C于本周三前完成引导页静态图B协调一名开发人员周五前确认技术排期A下周一前输出完整需求文档并同步各方。这种颗粒度和结构化程度才是符合一线工作习惯的纪要形态。V8.4在处理完之后甚至能自动生成一段“给未参会同事看的简报版”只有核心结论和待办很贴心。4. 常见问题与排查技巧实录4.1 转写错误与口音问题的修正技巧转写错误不可能完全避免尤其涉及专业术语、生僻人名和方言口音。针对这类问题V8.4支持在转写结果上直接编辑修正后的词会同步更新到后续所有结构化提取结果中。这个设计对用户非常友好——只需要改一次就不用担心纪要里反复出现同一个错误词。我们内部测试时发现一个有意思的现象很多用户不知道可以上传“术语表”。在设置里添加本行业的专有词汇和缩写比如“ROI”“埋点”“瀑布流”转写模型会优先匹配这些词。实测加上术语表之后专业会议的转写准确率能提升five个百分点左右。4.2 多发言人混淆的修正方法多发言人识别在真实场景里仍是最大短板。电话会议中多人轮流说话尤其是不同人用同一部设备时声纹聚类经常把两个声音相近的人合并成一个。V8.4提供了一套修正流程。第一在转写文稿中点击“修改发言人”将这整句话的角色拖拽给另一个人模型会立刻重新分析该说话人的后续发言并进行关联修正。第二上传参会人名单并手动绑定声纹样本在“参会人管理”里可以回放某一声纹ID的若干句录音确认是谁的声音后再绑定名字。第三如果某个讨论环节说话混乱实在无法分清可以标记为“多人讨论”纪要中该环节自动折叠仅保留结论提取。4.3 纪要内容过长的压缩策略用户经常反馈“纪要还是太长”。其实很多时候不是AI摘要能力不行而是会议本身就是信息密度极低的重复讨论。针对这种情况V8.4在“精简”详细档之外还新增了一个“待办优先模式”只输出核心结论和待办事项其他全部折叠到一个可展开的“讨论背景”里面去。这样有效长度经常只有标准版的不到三分之一。压缩时也有一个绕不过去的问题——模型会把一些看似重复但实际包含关键让步条件的对话误删。比如有一场合同谈判经过多轮拉锯后双方才在付款方式上达成妥协如果只保留最后一句“付款方式改为分三期”后来者就无法理解为什么是“改”不是“本来就是”。V8.4在处理时会在结论栏自动补一句“该结论系多轮讨论后达成初始方案为全额预付”实录测试中大概有六七成场景能自动补上剩下的还是需要人工扫一眼。4.4 输出格式与协作场景的兼容纪要好用还要方便别人用。V8.4支持导出Markdown、Word、PDF、纯文本四种格式也支持一键复制为富文本粘贴到飞书文档、钉钉或者邮件里时格式基本不乱。这个需求看起来不起眼但公测期间非常多用户反馈“粘贴到企微会话里显示正常”是刚需。团队协作方面V8.4支持将纪要直接分享到群聊生成长图长图会把核心结论和待办事项置顶。对会议主持人来说还有一个隐藏技巧可以在创建会议时直接录入“预期议题”AI处理时会优先保证这些议题的讨论内容被充分提取没有录入的议题则自动归入“补充讨论”。公测用户对这个功能的依赖度极高尤其适合有固定议题模板的例会场景。4.5 一个容易被忽略的“录音质量”问题排查最后想单独说一个排查经验。很多用户上传录音后反馈识别效果差我们排查下来真正问题不在算法而是录音本身的质量。超过一半的录音是单声道电话会议录屏音质差、音量小、还有大量回声。V8.4在音频预处理阶段增加了自动降噪和增益平衡能稍微缓解但根治不了。这里特别值得给团队分享一个实测技巧如果录音明显嘈杂先用格式工厂或Adobe Audition转一次采样率提升到44.1kHz、切除低频噪声段再导入V8.4处理整体准确率的提升幅度经常能让团队以为是换了新模型。做AI纪要有时候前处理比模型本身更重要。5. 从这次迭代中看到的边界与机会5.1 技术边界哪些坑暂时填不上虽然V8.4在公测中表现不错但我们必须诚实地面对几个还没彻底解决的短板。跨天或多阶段的“长期会议”处理效果还不理想模型容易把第一天讨论和第二天结论搞混目前只能靠分段处理加人工合并。另外涉及复杂逻辑推演的讨论比如代码架构评审中偏数学化的推证模型提取结论时还是偏机械偶尔会漏掉关键论据。更现实的问题是多语言混说的场景。公测中有一场会议中英混杂比例大概七比三模型输出的中文纪要偶尔会把英文原句直译成中文但如果英文部分是专业名词比如某个框架的名字直译反而制造了理解障碍。这类问题我们目前靠“保留原文术语”规则做了兜底但还没从模型层面完全解决。5.2 产品机会纪要正在变成“组织记忆”的入口从这次V8.4的反馈数据看用户对纪要的期待正在悄悄发生变化。过去纪要的核心价值是“记录供查阅”现在越来越多的用户开始把纪要当作“知识库沉淀”的输入源。有个测试用户的原话让我印象很深“以前开会是开完就忘现在纪要是我们团队复盘时翻的最多的资料。”这对产品来说是个明确的机会。我们在V8.4的路线图里已经预留了“纪要知识库”模块的方向把历次纪要按主题、人员、决策串成时间线从而支持“查一下半年前我们为什么决定用这个方案”这类回溯查询。这个方向如果能落地AI纪要不只是在“帮人省时间”而是在“帮组织真正积累记忆”。这个价值比单次省下半小时的开会记录时间要打得多。5.3 数据安全与用户信任这轮迭代的隐形重点最后必须聊聊数据安全。据观察很多团队对上传会议录音到云端始终有顾虑。V8.4在部署方案上做了私有化版本核心语音识别和大模型处理全链路本地运行录音文件可以做到完全不出内网。这套方案在公测里成了很多企业客户愿意深入试用的决定性因素。值得提醒的是任何做类似产品的人都应该尽早把数据合规和安全方案纳入架构设计而不是等产品成熟后再补。从功能上看这点跟纪要质量无关但从用户信任度上看它就是生死线。写在最后几个真实的协作感想做这轮V8.4我自己最大的感悟是AI纪要这个功能真正的门槛不在“AI”而在“纪要”——你对一个优秀人类会议记录员的工作方式理解有多深产品就能做得多好用。转写准确率从95%提到98%用户毫无感知但把一条“布局B”待办修正成“设计B需要本周内给出新版布局图交付给开发并抄送产品A”用户立刻觉得“这产品懂我”。所以如果你也在做类似的产品我的建议非常简单花一个下午坐在一个优秀记录员旁边看他怎么记笔记、怎么在会后花五分钟把乱糟糟的速记整理成干净利落的纪要再把那个过程拆成步骤交给模型。做AI工具不该是想当然地“让AI替代人”而是把专家脑子里的隐性知识显性化、工程化。这次V8.4的很多设计细节其实就是这么来的。还有一个特别具体的经验想分享别忽视“改动成本”对用户耐心的影响。V8.4前几版测试时用户看到一篇结构完整的纪要第一时间不是高兴而是担心——“我得检查一遍它哪里错了”。新版本我们强化了每句话可点击定位到录音、每处结论可单独修改并局部重算这种颗粒度的修正交互虽然实现起来繁琐却让用户从“审稿人”心态切换回“使用者”心态。实实在在的体验跃迁往往就藏在这些不显眼的细节里。如果这篇梳理对你有点用后面我还会单独写一篇关于“结构化提取提示词模板”的拆解文章把我们在公测版本里试过的十几版提示词差异一次性放出来省得大家重复踩我们踩过的坑。
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/10/1 9:17:38
2021年5月机器学习 Python 库周榜解读:best-of-ml-python 榜单变动全解析
2026/10/1 9:17:38
用WorkBuddy搭建自动AI日报:定时触发、内容总结与微信推送全攻略
2026/10/1 9:17:38
12种相关系数详解与选型指南:从皮尔逊到ICC
2026/10/1 10:08:09
手写Servlet+JSP+MySQL新闻系统实战指南
2026/10/1 10:08:09
diff-so-fancy 缺陷报告指南:用 report-bug.sh 一键复现并提交高质量 Bug Report
2026/10/1 10:08:09
搅拌摩擦焊+液冷板+热管的集成设计:一份工程清单
2026/10/1 10:08:09
MCP+Excel+AI工作流:用自然语言驱动表格自动化
2026/10/1 10:08:09
原生/移动端 UI 专业交付规范与 Pre-Delivery 检查清单:ui-ux-pro-max `pro-rules` 完全解读
2026/10/1 10:03:09
东南大学编译原理试卷全解析:考点分布、解题模板与两轮复习法
2026/10/1 0:01:36
我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
2026/10/1 0:01:36
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026/10/1 0:01:36
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)
2026/9/29 11:29:08
网站建设的英语怎么说?别只背单词,看完这套安全完整流程才敢上线
2026/10/1 8:09:25
新手入门看这篇:建设网站加盟避坑指南与SEO实操
2026/9/29 14:07:33
论文AIGC疑似度是什么意思?想查论文AI率有哪些免费工具?
2026/10/1 0:01:36
我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
2026/10/1 0:01:36
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026/10/1 0:01:36
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)