开篇同一天的两条消息2025 年 10 月 16 日Anthropic 发布了一个新东西叫技能Skills。它的定义简单到近乎可疑技能就是一个文件夹里面装着指令、脚本和资源模型需要时自己去读。官方给出的最短描述是——一个 Markdown 文件教会 Claude 一次如何做某件事之后 Claude 会在相关时自动应用这些知识。当天一位写了二十多年技术博客的资深从业者写了一篇评论标题就是一句判断技能很酷可能比 MCP 更重要。他给出的理由不是能力而是简单MCP 是一整套协议规范而技能只是Markdown 加一点 YAML 元数据再加几个可选脚本。四个月后有人用数据打了这个判断一巴掌。2026 年 1 月底一家做前端框架的公司在自己的博客上公开了一份评测结果——在 56% 的评测用例里技能根本没有被触发。一个简单到可疑的东西为什么一半时间不起作用另一半时间却能让人把 6700 笔交易在 7 分 29 秒里做完这篇文章想回答的就是这个问题。而答案可能会让你有点意外技能不是更聪明的 AI它是被写下来的流程。一、先看它能干什么三个行业三种实测在讨论原理之前先看三件真事。法务把发布前一天变成提前一天Anthropic 自己的法务副总演示了一个具体工作流痛点非常真实。她的原话是没有律师喜欢一遍又一遍做同样的重复动作。这类工作枯燥而且容易出错。最典型的场景是市场材料的法务审核——以前市场团队可能在我发布前一天才来找我说『我们明天有个特别重要的发布抱歉博客文章刚定稿需要你快速读一遍、标出任何可能有问题的地方。』于是她做了一件很朴素的事只对 Claude 说了一次——帮我建一个工作流这是我在意的东西。她的原话是让我意外的是Claude 直接就把它跑起来、搭好了。现在的工作流是这样的市场人员打开自检工具把稿子粘进去点分析内容。Claude 会识别出需要处理的问题——在她演示的那次里是5 个准确性、安全声明、第三方内容的宣传权、合作方考量。它还会给出哪些地方看起来不错的肯定并基于她给的框架给出低/中/高风险信号然后一键生成给法务团队的 Slack 消息、一键提交工单。她对这个工具的角色定位说得很准它就像我第一遍筛查的眼睛和耳朵。但她紧接着说了全篇最重要的一句我总是努力确保法务团队的人留在回路中。我们知道 AI 系统仍然会产生幻觉。她还提到法务部门在用它做合同红线批注、利益冲突政策审核、外部业务活动申请审核。而她对同事的建议只有一句想想你最例行的工作打开它试一把。你真的不知道它能做什么直到你试一次。会计6700 笔交易7 分 29 秒如果说法律行业的演示还带着官方宣传的味道那会计这一份就是硬碰硬的基准测试。做测试的是一位有 15 年经验的税务专业人士。他先拿最简单的试三个月的银行对账单67 笔交易让 AI 录入表格模板并分类。结果分类准确表格底部的余额和第三个月对账单的期末余额对上了。然后是670 笔12 个月对账单——12 分钟再然后是6700 笔——7 分 29 秒余额和最后一份对账单的期末余额一致。中间还有一个很能说明问题的优化细节。他发现分类每笔交易是最慢的部分——AI 会为每一笔去想甚至去研究这个供应商是什么。于是他做了一个技能在分类过程中即时创建供应商映射表第一次看到一个新供应商时想一次之后每次都自动按之前的选择分类。效果是670 笔的测试从 12 分 10 秒降到 3 分 12 秒。他还做了两件更狠的事。收据41 张收据链接到 Excel 里对应的交易并重命名约 60 秒——而且这些收据是 PDF 里的图片AI 必须对每一张做 OCR。报税三份客户税务文件最厚的一份57 页要录入一份 1040 工作底稿花了近 30 分钟录入了 349 条记录。他的复核结论是我是一个有 15 年经验的税务专业人士我复核了它做的工作看起来是对的。最能说明问题的是反向测试。他人为植入了 10 处错误把一笔 401k 转存改成应税、删掉一个分配代码、把一个 W2 州 ID 号改了一位、改掉州退税的年份、编了一笔 1099 利息、把学生贷款利息改了 20 块、改了一个账号……然后让 AI 去批改卷子。不到一分钟全部找出。但他也说了全篇最重要的一句如果我那家 40 人的事务所有这个我会改变所里每个人的工作方式。问题是我还不能放心把敏感的客户信息交给它。这不是谦虚。他给出的理由是具体的这个工具目前处于研究预览阶段Claude 自己也说可能还不该用于受监管的工作流。而在美国至少税务工作肯定是受监管的工作流。营销机构收 5000 到 10000 美元的事两分钟做完第三个行业给出了最有冲击力的对比。一位自动化从业者用 15 个技能搭了一个营销审计工具。他先拿一个知名网站跑五个智能体并行两分钟出结果——75 分满分 100PDF 报告里有执行摘要、内容与信息、转化优化、SEO 与可发现性等各项评分拆解以及按严重程度分级的关键发现。然后他换了一个本地医美诊所再跑64 分C-。关键发现第一条是肉毒素套餐定价不一致——一个页面写100 单位 1400省 400另一个页面写同一套餐1500省 300。第二条是全站零元描述。他给出的对比是营销机构为接下来我要展示的东西每月收 5000 到 10000 美元而我免费教你搭出来。他还点破了一个双向痛点企业现在极度渴望营销帮助但他们付不起机构另一面有人想开 AI 自动化机构却没有可交付的工具。图同一套方法在法务、会计、营销三个行业各自跑出实测结果三个行业三种完全不同的活都跑出了结果。但请注意一件事这三个案例里真正起作用的都不是AI 更聪明了。法务的案例里起作用的是她把我在意什么写成了流程会计的案例里起作用的是有人把怎么分类变成了可执行的步骤营销的案例里起作用的是有人把怎么审计一个网站拆成了 15 个模块。那为什么写下来这么管用这要从技能这个东西本身说起。二、它凭什么有用简单到能被写下来Anthropic 官方的说法是技能是文件夹里面是指令、脚本和资源。它给了四条特性——可组合、可移植同一格式跨 Claude 应用、Claude Code 和 API、高效只在需要时加载需要的东西、强大可以包含可执行代码。官方的比喻是自定义入职材料你把自己的专业经验打包起来让 Claude 成为你所在领域的专家。在 Anthropic 自己的技术分享里两位讲者把这个设计哲学讲得更透。他们用了一个很形象的对比你希望谁来帮你报税是一个智商 300 的数学天才还是一位有经验的税务专业人士我每次都会选后者。我不想让数学天才从第一性原理出发去推导 2025 年的税法。我需要的是领域专家的稳定执行。他们接着说了一句很关键的话今天的智能体很像那位数学天才——才华横溢但缺乏专业经验。它们能做成了不起的事但常常一开始就缺少重要的上下文也不会随时间学习。所以技能的设计取向是刻意简单。讲者的原话是换句话说它们就是文件夹。这种简单是刻意的。因为只有足够简单任何人都能创建——不管是人还是智能体只要有台电脑就行。这里有个容易被忽略的工程细节也是技能和提示词最本质的区别渐进式披露progressive disclosure。会话开始时模型看到的只是每个技能的名称和描述——大概几十个 token。只有当它判断某个技能和当前任务相关时才去读完整的 SKILL.md只有当技能指示要用某个引用文件时才把那个文件加载进上下文。正因为这样一个智能体才能同时拥有成百上千个技能而不把上下文塞爆。图一个文件夹装下专业经验比一整套协议规范更轻对比一下 MCP 就更能看出这个选择的代价与收益。MCP 是一整套协议规范——hosts、clients、servers、resources、prompts、tools、sampling、roots、elicitation还有三种传输方式。那位资深从业者点出了它最要命的问题GitHub 官方那个 MCP单独就要吃掉数万 token 的上下文再挂几个留给模型真正干活的空间就所剩无几了。而技能只是Markdown 加一点 YAML 元数据——它把难的部分外包给了模型和运行环境自己只负责把事情说清楚。但简单是一把双刃剑。正因为简单AI 也可能根本不知道什么时候该用它。三、那为什么有时没用56% 的用例里它没被触发2026 年 1 月 29 日Vercel 在官方博客上公开了一份评测。他们要解决的问题很具体Next.js 16 引入了use cache、connection()这些新 API不在模型训练数据里智能体不知道就会写错代码。两条路一是做成技能按需调用二是把文档索引直接塞进AGENTS.md每一轮都在上下文里。他们原本押注技能——技能看起来是更对的抽象。然后他们跑了评测。结果很难看在 56% 的评测用例里技能根本没有被触发。智能体有文档访问权但它没用。加了技能和没加一样通过率都是53%——和完全没有文档的基线一模一样。更糟的是在某些细分指标上技能甚至比基线更差测试项 58% 对 63%——作者推测环境里有个没被用上的技能可能引入了噪声。他们不死心在 AGENTS.md 里加了显式指令先探索项目结构再调用 nextjs-doc 技能获取文档。 触发率升到 95% 以上通过率到了79%。但接下来发现的事更让人不安指令的措辞会大幅改变行为。你必须调用技能会让智能体先读文档、锚定在文档模式上反而漏掉项目上下文先探索项目、再调用技能效果更好。作者的原话是如果微小的措辞调整就能带来巨大的行为摆动这个方案在生产使用上感觉是脆的。最后赢的是笨办法。他们把文档索引压缩到 8KB直接嵌进 AGENTS.md——通过率 100%。作者自己都说这不是我们预期的结果。那个笨办法一个静态 Markdown 文件打败了更复杂的、基于技能的检索。不过他们没有把话说死。结论是克制的技能不是没用。它更适合垂直的、动作特定的工作流由用户显式触发——比如升级我的 Next.js 版本迁移到 App Router这种明确指令。两种方式互补。图评测发现技能未被触发而静态文档索引反而拿到满分请特别注意这个结论的措辞由用户显式触发。也就是说技能能不能生效取决于它有没有被写清楚到能被准确识别。写得含糊AI 就不知道什么时候该调用它——这正是那 56% 的来源。那写清楚了到底能带来多少提升四、到底有没有用第一份配对评测有人决定不再靠感觉争论而是做评测。2026 年 2 月一篇论文挂上了 arXiv标题叫《SkillsBench基准测试智能体技能在多样任务上的效果》。它做了第一件严格的事配对评测——同一批任务一组不带技能、一组带精选技能其他条件完全一致。规模是87 个任务、8 个领域、18 个模型-脚手架配置每个任务都配了确定性验证器不是让模型自己打分而是有客观的对错。结果出来了精选技能把平均通过率从 33.9% 提升到 50.5%——增加了 16.6 个百分点归一化增益 25.5%。但这个数字还不是最有意思的。论文里两条结论更反直觉第一聚焦的技能胜过更大更全的技能包。论文的原话是最多三个模块的聚焦技能胜过更大或穷举式的技能包。 这直接反驳了把所有东西都写进去的直觉——因为技能写的是流程不是资料汇编。第二带技能的小模型可以匹敌不带技能的更大模型。换句话说技能可以在一定程度上替代模型规模。第二条结论尤其关键。它说明这 16.6 个百分点不是模型更聪明了带来的——是流程被写清楚了带来的。那写清楚具体指什么五、核心有用的不是技能是被写下来的流程一位长期推广 Google 工程实践的开发者写了篇长文给出了最精确的表述技能不是参考文档而是工作流。他的原话值得完整读一遍技能不是参考资料不是『关于测试你应该知道的一切』。它是一个工作流一系列智能体遵循的步骤带产生证据的检查点以明确的退出标准结束。为什么这个区分是整件事的关键他给了一个极具体的例子如果你把一篇 2000 字的测试最佳实践文章放进智能体的上下文智能体会读完它、生成看起来合理的文字、然后跳过真正的测试。如果你放进去的是一个工作流先写失败的测试、运行它、看着它失败、写最少的代码让它通过智能体就有事可做你就有东西可验证。他把这个原则概括成六个字过程优于散文process over prose。这也顺带解释了一个现象为什么那么多AI 规则仓库在实践中毫无作用——因为那些规则是散文。图把散文改成带检查点的工作流并为常见借口预先写好反驳那怎么防止 AI 在流程里偷懒他提出了一个最值得抄的设计反合理化表anti-rationalization tables。做法是把智能体或者一个疲惫的工程师可能用来跳过流程的借口配上写好的反驳。他给的例子很真实这个任务太简单不需要规格。 → 验收标准仍然适用。五行可以零行不行。我之后再写测试。 → 之后是关键词。没有之后。先写失败的测试。测试过了发布吧。 → 测试通过是证据不是证明。有人读过 diff 吗他解释这个设计为什么有效大语言模型非常擅长合理化。它们会产出一段听起来合理的文字解释为什么这个特定任务不需要规格。反合理化表是写给智能体还没说出口的谎言的、预先写好的反驳。道理讲完了但具体怎么把它写出来一位一线实践者给出了可能比方法论更管用的路径不要先写技能先陪它跑通一次。他讲了自己的失败案例。他让智能体研究赞助商邮件判断值不值得合作。结果——我发的每一封赞助商邮件它的回答都是『靠谱、靠谱、靠谱、完美、完美、完美』。没有一次拒绝没有一次说『这家不行』。它根本没做深度研究。于是他意识到模型需要一个逐步指南。但接下来他做了一件很多人不会做的事——他没有立刻去写技能。他说很多人会先识别出自己有个工作流然后立刻跳去创建技能。这是你能做的最糟的事。他的做法是先陪着它一步步走完这个工作流。他会告诉它查他们的 Twitter、查 YouTube、查 Trustpilot、查有没有融过资如果其中两项不存在或状态不佳自动拒绝。跑通一次、两次之后他再对 AI 说回顾你刚才做的然后创建技能。他把这叫做递归地构建技能技能写出来之后智能体某个时候还是会搞砸——因为技能里还有信息缺口。当它搞砸时你把失败反馈给它让它修好然后告诉它带着这个新修复更新技能让这件事不再发生。他的 YouTube 报告生成器从 8 个数据源拉数据经历了五轮这样的迭代现在每次都能完美执行。他还说了一句很诚实的话有一段早期投入期很难受没人会告诉你。他花了两周。技能写好了放在哪、谁能用、怎么保证大家用的是同一版这个问题在 WorkMate 里有一层现成的答案管理端的「SKILLS 服务管理」接受.zip技能包上传包内需有合法SKILL.mdYAML 头至少含 name/description/version后端自动解析并规范化版本号列表里直接显示最新版本与包状态授权是按人做的——左侧部门-成员树可以逐人勾选。员工详情里的「Skill 技能」页签会显示每个技能的版本号与启用态。技能不是一份散落在各人电脑上的文档而是一件有版本、有归属、有授权范围的组织资产。但写下来这件事还有另一面。六、边界写下来的东西也可以被投毒2026 年 2 月一位安全从业者在技能市场里发现了一件事当时下载量第一的技能是一个Twitter技能——描述、用途、概览看起来完全是那种你会毫不犹豫安装的东西。但它做的第一件事是引入一个名为openclaw-core的必需依赖附带看起来像正常文档指针的链接。两个链接都指向恶意基础设施。完整攻击链是技能概览让你装前置依赖 → 链接到诱导页 → 命令解码混淆载荷并执行 → 载荷拉取第二阶段脚本 → 脚本下载并运行一个二进制还移除了 macOS 的隔离属性以确保系统的 Gatekeeper 不会扫描它。他把这个二进制安全下载后提交 VirusTotal。结论毫不含糊macOS 窃密木马。这类恶意软件不满足于感染你的电脑它会洗劫设备上一切值钱的东西浏览器会话与 cookie、保存的凭证、开发者 token 与 API key、SSH 密钥、云凭证。他写下了一句被反复引用的话在智能体生态里Markdown 不是『内容』Markdown 是安装程序。图Markdown 可能是安装程序所以这一层需要来源、授权与留痕更麻烦的是这件事不能靠用 MCP 兜底来解决。他的解释很直接技能根本不需要使用 MCP。Agent Skills 规范对 Markdown 正文没有任何限制技能可以捆绑脚本执行可以完全发生在 MCP 工具边界之外。所以——如果你的安全模型是『MCP 会拦住工具调用』你依然会输给一个绕过 MCP 的恶意技能。而这不是孤例。据报道数百个技能被指涉及通过 ClickFix 式指令分发 macOS 恶意软件。他给出的判断是这不是一次性的恶意上传而是一场有组织的投放——用『技能』作为分发渠道用『前置依赖』作为社会工程的包装。他还点出了这件事为什么特别容易得手人们不认为一个 Markdown 文件会危险人们被训练成快速跟着安装步骤走人们相信『下载量第一』就等于可信。这正好印证了前面那位一线实践者的判断我不下载别人的技能。理由有两个——一是这是攻击别人的一个简单方式二是你的智能体需要『一次成功运行』的上下文而别人的技能里没有。技能从哪来、谁批的、能碰什么这是企业用技能绕不开的三个问题在 WorkMate 里对应管理端的几件事技能上传需要合法的SKILL.md与规范的 YAML 头上传后由后端统一解析授权按人做逐人勾选员工能调用哪些外部系统是在「MCP 服务」里精确到工具级控制的——服务卡上会显示启用工具数 x/y同一个服务里允许用哪个工具、不允许用哪个可以分开设置。出站内容还有一层「安全合规」关键词黑名单、违规动作的拦截或警告、以及基于大模型的语义审查每一条被拦下的消息都会进拦截日志。有两点需要如实说明管理端的「SKILLS 服务审批」目前是预留占位页页面可正常进入但功能尚未接入技能列表里的删除实际行为是从列表移除并停用历史包与授权记录会保留同名技能包重新上传后可以恢复。写在最后回到开头那个问题一个简单到可疑的东西为什么一半时间不起作用另一半时间却能让人把 6700 笔交易在 7 分 29 秒里做完现在答案应该清楚了。技能不是更聪明的 AI它是被写下来的流程。它之所以有用不是因为模型变强了而是因为有人终于愿意把自己那套只有他会做的东西第一次写清楚了。那三组数字如果换个角度读意思完全不同那 16.6 个百分点的提升不是模型变强了是流程被写清楚了。那 6700 笔交易 7 分 29 秒不是 AI 学会了会计是有人把怎么分类变成了可执行的步骤。那 349 条录入和 10 处错误不是运气——是有人先陪它跑通了一遍再把它固化成技能。所以如果你也想开始路径其实很短先陪它跑通一次再把它写成流程。不要一上来就写技能先做一遍让它看着你做然后对它说回顾你刚才做的把它写成技能。写完之后问三个问题谁能用能碰什么出问题查得到吗这三个问题答得上技能才真的从一份 Markdown变成了一层能力。