首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
七十年,四代技术,AI 终于学会了“说不知道“:一条文本分类的进化主线
📅 2026/10/8 18:59:16
✍️ 爱科研究院
👁 阅读 3,247
摘要这句话是不是在骂人这封邮件是不是垃圾邮件这个需求单该转给哪个团队——机器做这类判断的能力不是 ChatGPT 出现那天才有的。它有一条七十年长的技术主线词袋、循环网络、Transformer 分类头一直到今天的 Jev 式共享打分头外加一整套让模型知道自己不知道的置信度校准技术。这条主线最值得看的不是准确率涨了多少而是每一代技术都在回答同一个问题怎么让机器以一个可信的、能写进代码的置信度做出决定。本文沿着这条线走一遍对比四代技术的准确率与效率最后你会拿到一个判断框架你的系统里哪一步该用哪一代。正文一、AI 会聊天了但它会做决定吗先看一个日常场景。客服系统收到一条用户留言你们这个东西再不修好我就退订了。系统要做三个决定这是投诉还是咨询要不要升级给人工该走退款流程还是技术支持流程注意这里没有一个环节需要 AI 写一篇 500 字的散文。需要的只是三个带置信度的判断。这就是文本分类——AI 领域最老、最不性感、却每天被调用次数最多的任务之一。它的技术栈在过去七十年里换了四代每一代都更准、更快或者更便宜。而当你看完整条演进线会发现它其实一直在逼近同一个终点让机器做决定这件事变得像调用一个函数一样便宜、像读取一个概率一样可靠。我们一代一代看。二、第一代把句子拆成一袋词约 1990s–2014最早的思路朴素到近乎粗暴判断一句话的情绪不需要理解语序数词就够了。把这个东西好用但是客服态度差拆成一个词的集合每个词对应一个分数——好用加一分态度差减一分把整句话的分数加起来套一个逻辑回归输出正面/负面的概率。这就是词袋模型Bag-of-Words把句子当成一袋无序的词词的频率就是特征配上逻辑回归或朴素贝叶斯做分类。它的缺陷写在脸上——语序全部丢失。我推荐这家店和这家店推荐我在词袋眼里是同一句话。它自己也知道这个缺陷。图里那句很诚实的注释说模型放弃了理解语序换取的是简单性和速度。后来两种神经网络来补课。循环神经网络RNN逐词读句子像一个带着记忆的读者读到最后一个词时整个句子的语序已经被压缩进它的隐藏状态里。语序保住了但代价是必须一个词一个词地串行处理——快不起来长句子还会边读边忘。卷积神经网络CNN反其道而行用多个卷积核同时扫描局部词组抓住态度差不推荐这类关键短语最大池化之后分类。它快参数少2014 年 Kim 的 TextCNN 论文证明这种几层的小网络在情绪分类上就能打平当时的复杂模型——但它天然只看局部抓不住跨了半句话的转折逻辑。第一代的商业成就不应该被低估。垃圾邮件过滤、早期内容审核、情感倾向分析都是这一代技术撑起来的。它定义了这件事的成本下限很便宜但只能处理语序不重要的简单判断。三、第二代Transformer 接管2018–20242018 年BERT 出现游戏规则变了。BERT 的做法是先用海量文本预训练一个通用的语言理解模型然后在它上面接一个很薄的分类头取 [CLS] 这个特殊 token 的隐藏向量接一层线性层输出类别概率。预训练承担了理解语言的全部重活分类头只是最后轻轻一压。在 GLUE 这类基准上这一个动作把当时的最好成绩抬高了约 7 个百分点——这是那一代论文里罕见的跳跃。GPT 系列走的是另一条路后来殊途同归GPT-1 时代同样靠微调分类头做分类到了 T5干脆把所有任务统一成文本进、文本出——分类也被写成一个生成任务让模型把类别说出来。再往后大模型的 zero-shot 能力成熟一个没经过微调的大模型看几个例子就能给任意文本分类。这一代解决了准确率问题但暴露了两个新问题。第一个是贵。你用一个人均每秒能吐几十个 token 的自回归大模型去回答这封邮件是不是垃圾邮件这种只有一个比特信息量的问题。大模型为了给出这一个字要按生成的方式逐字计算延迟以秒计成本按 token 计。还是那个比喻开着卡车去送一封信。第二个更隐蔽模型不知道自己不知道。大模型会以极其流畅的语气给出一个错误判断并附上三段理由。它的自信和它的正确率是脱钩的。这个问题在第一代逻辑回归上就存在但在大模型上被流利的语言放大了——错误被包装得更有说服力。四、第三代Jev 式共享打分头2025 至今于是演进线走到了最新一代也是 Jev 所代表的那一类把分类从生成里彻底拆出来。具体机制值得细看。传统做法是把候选答案一个个丢给模型问是不是它Jev 式的做法是把所有候选项放进同一个前向计算里用一个共享的打分头并行评估——图里画得很清楚多个候选输入共享同一个 cross-attention 打分层一次算出每个候选的分数再输出带概率的选择结果。这一代的技术特征可以压缩成三句话不用生成用打分。没有逐字生成的过程输出 token 侧的计算几乎免费响应时间从秒级压到百毫秒级。厂商 TypeSafe 自报的数据是比同任务 LLM 方案快约 194 倍、便宜约 445 倍——数字要打折看方向是可信的。输出的是类型化结构不是字符串。返回的是选项 概率 置信度可以直接被程序消费不存在解析失败的问题。置信度是一等公民。每个判断自带校准过的置信度置信度低就升级给人——这个分流逻辑写在代码里不依赖模型自觉。回头看你会发现第三代的很多能力其实是第一代的回归不做生成、直接出概率、便宜、快。区别在于底层从几百万参数的逻辑回归换成了预训练过的、能理解语序的深层网络。绕了一大圈机器做决定这件事的形态反而回到了最接近逻辑回归的样子——只不过这一次它同时拥有理解语言的能力。五、贯穿四代的暗线让模型知道自己不知道还有一条横切所有时代的暗线用户的原文专门把它列为一节——校准Calibration。问一个要命的问题模型输出90% 是垃圾邮件这真的意味着在类似样本上它有 90% 的时候判对吗不一定。现代深度网络普遍存在过度自信错的判断也敢报 95% 的置信度。这个问题 2017 年 Guo 等人在论文《On Calibration of Modern Neural Networks》里被系统性地指出来他们顺手给了一个极简的修法——温度缩放Temperature Scaling在 logits 上除以一个温度参数 T再过 softmax。整个校准只有一个参数用验证集上找到合适的 T几乎不改变准确率排序但能显著降低校准误差ECE。这是机器学习史上性价比最高的补丁之一一行代码换回模型说的话敢不敢信这个底层能力。温度缩放是事后校准。更新的做法是把校准直接写进训练目标——带校准奖励的强化学习奖励函数设计成答对加分置信度偏离真实准确率扣分形如 R 正确 − λ·|置信度 − 准确率|。模型不再是先学会答对、再被校准而是从训练第一天起就被逼着学会两件事做对以及诚实地报告自己有多确定。为什么这件事值得单开一节因为它是自动化的分水岭。置信度一旦可信不确定性就从模型的感觉变成了代码里的变量。你可以写置信度大于 0.9 自动执行0.6 到 0.9 抽检低于 0.6 转人工。整个系统的准确率和人力成本第一次可以精确地互相定价。没有校准AI 判断的输出只能看看参考有了校准它才能接管生产流程。六、四代同框一张对比表把四代技术放在一张表里对比第三代性能数据为厂商自报待独立验证维度第一代词袋LR / RNN / CNN第二代BERT/T5 分类头第三代Jev 式打分头校准层贯穿各代语序理解无词袋/局部CNN完整完整—准确率简单任务够用大幅跃升接近 LLM 上限不改变准确率改变可信度延迟毫秒级LR/CNN秒级生成式更慢百毫秒级增加可忽略相对成本极低高按生成计费低输出近乎免费极低输出形式概率文本/概率类型化结构置信度校准过的概率置信度可信吗基本不可信过度自信设计目标即可信可信这是它的本职商业结论藏在表里任务的复杂度和技术的代际不必强行对齐。语序不重要的过滤任务第一代今天依然是性价比之王需要理解长上下文的判断第二代、第三代上场而无论哪一代只要判断要进生产流程校准层都不该缺席。给你一个可以拿走的判断顺序先问这一步判断的答案空间是不是封闭的——封闭的别用生成式模型第一代或第三代里挑再问置信度要不要进代码——要进校准不是可选项最后才是剩下的那些真正需要理解和生成的部分留给大模型。结语这条七十年长的演进线最反直觉的地方在于它的形状。它不是一条模型越来越大的单行道。第一代用最笨的方法证明了判断可以便宜第二代用大模型证明了判断可以很准第三代把两件事合了起来——准确且便宜而校准技术给整条线补上了最后一块判断不仅要对还要知道自己有多对。Jev 创始人 Diogo Almeida 说过一句话机器做决定的成本每降一个数量级软件里就会长出一代人以前根本不敢想的自动化。垃圾邮件过滤是 2000 年代的那个自动化工单路由是 2010 年代的而置信度可控的实时业务决策可能是接下来十年的。每一次都不是模型变聪明了多少而是做对一次判断的单价又便宜了一档。互动话题你的系统里现在跑着的判断逻辑是哪一代有没有那种明知大模型杀鸡用牛刀、但没精力换的环节评论区聊聊。免责声明文中技术演进脉络基于公开论文与资料Guo et al. 2017《On Calibration of Modern Neural Networks》、Kim 2014 TextCNN、BERT/T5 原始论文等Jev 相关性能数据快约 194 倍、便宜约 445 倍来自 TypeSafe AI 厂商自报基准尚无充分独立验证。本文不构成任何技术选型或采购建议。
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/10/8 18:59:16
WordPress Agent Skills 玩转 REST API:路由注册、Schema 校验与认证授权详解
2026/10/8 18:59:16
Python 入门实战:用循环和条件判断实现「坐标移动与路线记录」
2026/10/8 18:59:16
Android显示链路全景解析:从App绘制到屏幕输出的关键节点
2026/10/8 19:49:27
类变量和实例变量在内存中存储的方式对代码的调试有哪些影响?
2026/10/8 19:49:27
大电网可靠性评估:快速蒙特卡洛仿真、风险分级与术语统计报告实战
2026/10/8 19:49:27
新能源并网小干扰稳定性术语统计:同步方式与控制技术高频词解析
2026/10/8 19:49:27
K8S NodePort暴露Sentinel控制台:端口链路与Java客户端接入全解析
2026/10/8 19:49:27
K8S NodePort 下 Sentinel 端口配置详解:控制台与客户端双向链路排查实践
2026/10/8 19:44:26
Matlab/Simulink光伏+水力发电系统仿真:从建模到调试全流程解析
2026/10/8 0:04:11
Agent Skills 完全指南:原理、写法、安装与实战避坑
2026/10/8 0:04:11
Agent Skills 实战:从 Genkit 定义到 GKE 部署与排查
2026/10/8 0:04:11
Agent Skills 实战:从设计到调试的完整指南
2026/10/8 5:02:14
Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化
2026/10/7 9:55:49
多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系
2026/10/7 14:02:03
hindsight:面向LLM应用的事后可观测性工程实践
2026/10/8 4:30:43
我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
2026/10/8 2:46:15
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026/10/8 4:32:33
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)