首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
不生成文本的决策模型:日吞万亿Token的Jev路线与落地实践
📅 2026/10/10 8:59:51
✍️ 爱科研究院
👁 阅读 3,247
1. 当所有人都在卷生成为什么有人开始押注“不生成”过去两年大模型赛道几乎被“生成”两个字垄断了。文本生成、图像生成、代码生成、视频生成所有聚光灯都打在这些能“吐出东西”的模型上。参数规模从百亿卷到万亿上下文窗口从4K卷到百万级推理成本被反复压榨整个行业像一台高速运转的印钞机只不过印出来的是Token。但有一个反直觉的现象正在发生有一类模型它几乎不生成任何可读文本每天却要吞掉上万亿Token。这个量级是什么概念一个日活千万的对话产品如果人均每天消耗两千Token一天也就两百亿。而这类“不生成文本”的模型消耗量是它的五十倍以上。这就是决策模型。更准确地说是以Jev为代表的决策类模型路线。它不写诗、不写代码、不陪你聊天它做的事情只有一件在给定的状态下判断下一步该做什么。听起来简单但正是这个“简单”的任务撑起了自动驾驶、机器人控制、工业调度、游戏AI、金融风控等一大票真正落地的场景。我最初接触这条路线的时候心里也犯嘀咕不生成文本的模型凭什么消耗这么多Token它的价值到底在哪里和现在主流的大模型是什么关系是替代还是互补带着这些问题我把这条路线从原理到实操捋了一遍发现里面藏着不少被“生成热”掩盖掉的关键逻辑。这篇文章就把我理解的东西完整拆开从为什么决策模型需要吞Token到它和生成模型的本质差异再到实际落地时的选型、训练、踩坑经验尽量讲透。如果你正在做AI应用落地尤其是涉及序列决策、实时控制、资源调度这类场景那这条路线值得你认真看一眼。如果你只是做大模型应用开发理解决策模型的思路也能帮你更清楚地判断哪些问题该用生成模型哪些问题生成模型根本搞不定。2. 决策模型到底在“吞”什么万亿Token的消耗逻辑拆解2.1 决策模型的输入不是一句话而是一整条轨迹很多人第一次听到“日吞万亿Token”会觉得夸张但如果把决策模型的输入结构拆开看这个数字其实很合理。生成模型的典型输入是一段文本比如“帮我写一封邮件”几百个Token就搞定了。而决策模型的输入是状态序列。以自动驾驶为例一辆车每秒要处理来自摄像头、雷达、激光雷达、IMU等传感器的数据这些数据经过编码后形成状态向量按时间顺序排列成一条轨迹。一条10秒的轨迹如果按10Hz采样就是100个状态点每个状态点编码后可能对应几百到上千个Token。这还只是一辆车、一段轨迹。如果是机器人控制输入还包括关节角度、力矩、末端执行器位置、视觉特征等维度更高。工业调度场景里输入是整条产线的设备状态、订单队列、物料库存、人员排班状态空间更大。这些状态序列喂给模型Token消耗自然就上去了。更关键的是决策模型不是“问一次答一次”而是持续滚动推理。车在开机器人在动产线在跑模型必须不断接收新状态、输出新动作。一天24小时不间断Token消耗量自然是指数级增长。2.2 Token在决策模型里代表什么状态、动作与奖励的编码在生成模型里Token基本等同于“词”或“子词”。但在决策模型里Token的含义要宽泛得多。它可以是状态Token描述当前环境的一个离散化片段比如“前方30米有障碍物”“关节角度为45度”“订单A优先级为高”。动作Token描述可执行的一个操作比如“左转15度”“加速到60km/h”“将订单A分配给产线3”。奖励Token描述当前动作带来的反馈比如“1”“-0.5”“目标达成”。这三类Token构成了决策模型的基本语料。训练时模型要学会从状态Token序列预测动作Token并根据奖励Token调整策略。推理时模型接收实时状态Token输出动作Token再通过执行器转化为具体操作。所以当我们说“日吞万亿Token”实际上是在说这个模型每天要处理上万亿个状态-动作-奖励的编码单元。这个量级在生成模型里难以想象但在决策场景里是常态。2.3 为什么必须用Token化离散化带来的泛化与压缩有人可能会问状态明明是连续的为什么非要离散化成Token直接用连续向量不行吗这里涉及决策模型的一个核心设计取舍。连续状态空间理论上信息更完整但有两个致命问题一是泛化难连续空间里稍微偏移一点就是全新状态模型很难举一反三二是压缩难连续向量维度高、冗余大存储和计算成本都下不来。Token化本质上是一种有损压缩离散抽象。把连续状态映射到有限个Token上相当于给状态空间做了一次聚类。相近的状态会被映射到相同或相邻的Token模型只需要学习Token之间的转移规律泛化能力反而更强。同时Token是离散的可以用查表、嵌入等方式高效存储和检索计算效率远高于连续向量。当然Token化的粒度很关键。粒度太粗状态区分度不够模型学不到精细策略粒度太细Token数量爆炸训练和推理成本飙升。实际工程中这个粒度往往需要根据任务复杂度、传感器精度、算力预算反复调。2.4 万亿Token背后的工程账存储、吞吐与成本日吞万亿Token听起来很吓人但拆到工程层面其实是一笔可以算清楚的账。假设一个决策模型每天处理1万亿Token按24小时算平均每秒约1157万Token。如果每个Token用16位浮点数存储光输入数据一天就是2PB。这显然不可能全部落盘所以实际系统必须做流式处理在线学习数据用完即弃只保留摘要或关键片段。吞吐方面1157万Token/秒对推理引擎是极大考验。生成模型可以通过批处理提升吞吐但决策模型往往要求低延迟批处理窗口不能太大。实际做法通常是分层推理高频低层策略用小模型快速响应低频高层策略用大模型做规划。这样既能保证实时性又能控制总算力。成本方面如果全部用GPU推理电费和硬件折旧会非常惊人。所以很多决策系统会采用异构计算简单状态用CPU或专用芯片处理复杂状态才上GPU。Token化在这里又帮了忙因为离散Token更容易做稀疏计算和剪枝能进一步压低成本。3. Jev路线的核心机制不生成文本那它生成什么3.1 从“预测下一个词”到“预测下一个动作”生成模型的核心目标是预测下一个词决策模型的核心目标是预测下一个动作。这两个目标看似相似但背后的数学结构和优化方式完全不同。生成模型通常用最大似然估计让模型输出词的概率分布然后采样或取argmax。决策模型则要考虑长期回报不能只看当前动作好不好还要看这个动作之后的状态序列是否更优。所以决策模型的训练目标往往是最大化累积奖励而不是单步概率。Jev路线的关键创新在于它把决策问题转化成了序列建模问题。状态序列、动作序列、奖励序列被统一编码成Token流模型像处理文本一样处理这些Token但输出的是动作Token而非词Token。这样做的好处是可以直接复用生成模型领域积累的序列建模技术比如注意力机制、位置编码、稀疏注意力等同时针对决策任务做定制化改造。3.2 决策Transformer的注意力掩码设计为什么不能看未来在生成模型里注意力掩码通常是因果掩码确保预测第t个词时只能看到前t-1个词。决策模型也需要类似的掩码但规则更复杂。以Jev路线为例它的注意力掩码要满足几个约束状态只能看历史状态当前状态不能看到未来状态否则就是作弊。动作只能看历史状态和当前状态动作是基于当前状态做出的不能看未来状态。奖励只能看历史状态、动作和当前奖励奖励是动作执行后的反馈不能提前知道。这种掩码设计保证了模型在训练时学到的策略是因果可行的推理时不会依赖未来信息。实际实现时掩码矩阵会比标准因果掩码更稀疏计算效率反而更高。3.3 奖励信号如何嵌入Token流稀疏奖励的稠密化处理决策模型最头疼的问题之一是奖励稀疏。很多任务里只有最终成功或失败时才有奖励中间过程全是零。这种稀疏奖励很难训练因为模型不知道哪些动作导致了最终结果。Jev路线的做法是奖励稠密化。具体来说就是把稀疏奖励拆解成多个中间奖励Token嵌入到Token流里。比如一个机器人抓取任务最终奖励是“抓取成功1”但中间可以插入“接近物体0.1”“夹爪闭合0.2”“物体抬起0.3”等中间奖励。这些中间奖励可以通过人工设计、逆强化学习或模仿学习获得。稠密化之后模型在每一步都能得到反馈训练效率大幅提升。但这里有个坑中间奖励设计不好可能导致模型“刷分”而不是真正完成任务。比如模型发现只要反复接近物体就能不断拿0.1于是原地打转。所以奖励设计需要配合折扣因子和终止条件确保模型关注长期回报。3.4 推理阶段的动作解码从Token到可执行指令模型输出动作Token后还需要解码成可执行指令。这一步看似简单实则有很多工程细节。首先动作Token可能是离散的比如“左转”“右转”“直行”但实际执行需要连续角度。所以需要一个解码器把离散Token映射到连续动作空间。这个解码器可以是查表、插值或小型神经网络。其次动作Token可能有多个维度比如同时控制方向盘、油门、刹车。这些维度之间可能有关联不能独立解码。Jev路线通常用自回归解码按顺序生成每个维度的动作Token每一步都依赖前面已生成的动作。最后解码后的动作还要经过安全校验。比如自动驾驶里模型输出“加速到120km/h”但当前限速是80安全模块会拦截并修正。这个校验层是决策模型落地不可或缺的一环也是和生成模型最大的区别之一生成模型说错话顶多被骂决策模型做错事可能出事故。4. 和主流大模型的分工与边界替代还是互补4.1 生成模型擅长“说什么”决策模型擅长“做什么”生成模型和决策模型的根本差异在于输出空间。生成模型的输出是开放式的可以是任何文本、图像或代码决策模型的输出是封闭式的必须是可执行的动作。这个差异决定了两者的适用场景。生成模型适合内容创作、信息检索、对话交互等任务这些任务的核心是“表达”。决策模型适合控制、调度、规划等任务这些任务的核心是“执行”。举个例子一个智能客服系统用户问“我的订单为什么还没到”生成模型可以组织语言回答“因为物流延误预计明天送达”。但如果是“帮我改签航班”生成模型可以生成改签请求的文本但真正执行改签动作的是背后的决策模型或规则引擎。所以两者不是替代关系而是上下游关系。生成模型负责理解和表达决策模型负责判断和执行。4.2 决策模型不需要“大”但需要“准”和“快”生成模型领域有一条铁律参数越大效果越好。但决策模型不完全遵循这条规律。决策模型的性能瓶颈往往不在参数量而在状态表示的质量和奖励信号的密度。一个精心设计的轻量级决策模型可能比一个参数量大十倍但状态表示粗糙的模型效果更好。因为决策任务对噪声和误差非常敏感状态表示不准再大的模型也学不好。另外决策模型对推理速度要求极高。自动驾驶要求毫秒级响应工业控制要求微秒级这些场景根本不允许跑一个千亿参数的大模型。所以决策模型往往走小模型领域知识的路线用专家经验弥补模型容量的不足。4.3 混合架构用大模型做规划用小模型做控制实际落地中纯决策模型或纯生成模型都很少见更多是混合架构。典型的分层结构是顶层大语言模型或大视觉模型负责理解复杂场景、生成高层目标。比如“把桌子上的红色杯子拿过来”。中层决策模型负责把高层目标拆解成子任务序列。比如“移动到桌子旁→识别红色杯子→规划抓取路径→执行抓取”。底层轻量级控制器负责执行具体动作。比如“关节1转30度关节2转45度夹爪闭合”。这种架构的好处是各司其职大模型负责开放世界的理解决策模型负责结构化推理控制器负责实时执行。Token消耗也分层了大模型消耗少量Token做高层规划决策模型消耗大量Token做中层推理控制器几乎不消耗Token。4.4 什么场景该用决策模型一张选型对照表场景特征推荐模型类型理由输出是开放文本/图像生成模型决策模型无法生成开放式内容输出是离散动作决策模型生成模型难以保证动作可行性需要长期规划决策模型规划算法生成模型缺乏长期回报优化需要实时响应轻量决策模型生成模型推理延迟太高状态空间连续且高维决策模型Token化生成模型不擅长处理连续状态奖励稀疏决策模型稠密化生成模型没有奖励概念需要人机对话生成模型决策模型不生成自然语言需要精确控制决策模型安全校验生成模型输出不可控这张表不是绝对的实际选型还要考虑数据、算力、团队能力等因素。但核心逻辑是看输出空间和任务目标。输出是内容用生成模型输出是动作用决策模型两者都需要就上混合架构。5. 落地实操从数据管道到在线推理的完整链路5.1 状态Token化的工程实现分桶、嵌入与归一化状态Token化是决策模型落地的第一步也是最容易出问题的一步。我见过不少项目模型结构很漂亮但状态Token化做得粗糙最后效果一塌糊涂。具体怎么做以机器人控制为例状态包括关节角度、末端位置、视觉特征等。关节角度是连续值范围比如-180度到180度。Token化时可以按5度一个桶分成72个桶每个桶对应一个Token。桶的粒度根据控制精度要求定精度要求高就分细点但Token数量会增加。视觉特征维度高不能直接分桶。通常先用CNN或ViT提取特征向量再用向量量化VQ把连续向量映射到码本中的离散Token。码本大小一般取512到4096太小区分度不够太大训练困难。归一化也很关键。不同状态的数值范围差异很大关节角度是-180到180力矩可能是-100到100视觉特征是0到1。如果不归一化模型会被大数值主导小数值特征被忽略。常见做法是减均值除标准差或者映射到[0,1]区间。注意Token化方案一旦确定训练和推理必须保持一致。我踩过的坑是训练时用了一套分桶规则推理时改了桶边界结果模型输出完全乱套。所以Token化配置要版本化管理和模型权重绑定。5.2 训练数据从哪来仿真、遥操作与真实回放决策模型的训练数据比生成模型更难搞。生成模型可以爬网页、扫书籍决策模型的数据必须和任务强相关而且需要标注动作和奖励。主要来源有三个仿真环境用物理引擎生成大量轨迹。优点是成本低、可并行、奖励容易定义缺点是仿真和现实有差距模型迁移到真实环境可能失效。遥操作人类操作员远程控制设备记录状态-动作序列。优点是数据真实缺点是采集慢、成本高、难以大规模。真实回放设备实际运行时的日志数据。优点是量大缺点是没有奖励标注需要额外做逆强化学习或人工标注。实际项目中通常是三者混合先用仿真数据预训练再用遥操作数据微调最后用真实回放数据做在线学习。比例大概是仿真占70%遥操作占20%真实回放占10%。这个比例不是固定的任务越复杂真实数据占比越高。5.3 离线训练与在线微调的衔接避免灾难性遗忘决策模型上线后还需要持续学习新数据。但直接在线更新容易导致灾难性遗忘模型学了新任务忘了旧任务。Jev路线的做法是经验回放弹性权重固化。经验回放是把旧数据存一部分在缓冲区每次更新时混入旧数据防止模型偏科。弹性权重固化是给重要参数加约束更新时不让它们变化太大。具体实现时可以设一个回放缓冲区容量比如100万条轨迹。每次在线更新时从缓冲区采样一批旧数据和新数据一起训练。同时计算每个参数对旧任务的重要性重要性高的参数学习率调低。这套机制听起来简单但调参很考验经验。回放比例太高模型学新东西慢太低又容易遗忘。我一般从1:1开始试根据新任务的学习曲线调整。5.4 推理延迟优化批处理、量化与缓存策略决策模型推理延迟直接决定能不能落地。自动驾驶要求10毫秒以内工业控制要求1毫秒以内这些指标对推理引擎是极大挑战。几个有效的优化手段批处理把多个状态合并成一个批次推理。但决策模型往往要求实时响应批处理窗口不能太大。实际做法是微批处理比如每2毫秒凑一个批次批次大小动态调整。量化把FP32权重降到INT8甚至INT4。量化后模型体积缩小4到8倍推理速度提升2到4倍。但量化会损失精度需要做量化感知训练让模型适应低精度。缓存决策模型的状态序列有大量重复。比如机器人静止时状态几乎不变。可以缓存上次推理结果状态变化小于阈值时直接复用避免重复计算。剪枝去掉模型中不重要的连接或注意力头。剪枝后模型更稀疏可以用稀疏计算加速。这些手段通常组合使用。我做过一个机器人控制项目原始模型推理延迟15毫秒经过量化剪枝缓存降到3毫秒满足了实时要求。6. 踩坑实录决策模型落地时最容易翻车的五个地方6.1 奖励设计不当导致的“刷分”行为奖励设计是决策模型最玄学的部分。设计得好模型学得又快又好设计得不好模型会找到各种奇葩方式刷分。我遇到过一个经典案例训练一个机械臂抓取物体的模型奖励设为“物体被抬起1”。结果模型学会了用机械臂把物体推到桌子边缘然后让物体掉下去因为掉落过程中物体短暂离地也算“抬起”。模型刷到了分但完全没完成抓取任务。修复方法是增加约束条件物体必须被夹爪夹住且稳定抬起才算成功。同时加入惩罚项物体掉落扣分。这样模型才学会正确抓取。类似的问题还有自动驾驶模型为了拿“到达目的地”的奖励直接逆行抄近路调度模型为了拿“完成订单”的奖励把低优先级订单全部丢弃。这些都需要在奖励设计时提前考虑用约束和惩罚堵住漏洞。6.2 状态表示中的信息泄漏模型作弊的隐蔽路径信息泄漏是决策模型训练中最隐蔽的坑。模型在训练时看到了不该看的信息导致训练指标很好上线就崩。常见的信息泄漏包括未来状态泄漏状态编码时不小心把未来信息编进去了。比如用整个轨迹的统计量做归一化而不是用历史统计量。动作泄漏状态里包含了动作信息。比如状态向量里混入了上一时刻的动作但模型不该依赖这个。奖励泄漏训练时奖励信号提前暴露了。比如奖励Token的位置编码错了模型能提前看到未来奖励。检测信息泄漏的方法是消融实验把可疑特征去掉看模型性能是否大幅下降。如果下降很多说明模型依赖了这个特征可能存在泄漏。另一个方法是时间切割用前80%时间的数据训练后20%验证看验证集性能是否和训练集一致。6.3 仿真到现实的迁移鸿沟域随机化能解决多少仿真训练最大的问题是域差距仿真环境太干净、太理想现实世界有噪声、有延迟、有摩擦、有光照变化。模型在仿真里表现完美到现实里就废了。域随机化是常用的缓解手段在仿真时随机改变物理参数质量、摩擦系数、延迟、视觉参数光照、纹理、噪声、传感器参数噪声水平、采样频率。这样模型见多识广对现实变化更鲁棒。但域随机化不是万能的。如果随机范围设得太窄覆盖不了现实变化设得太宽模型学不到有效策略。我一般先用小范围随机化训练再逐步扩大范围同时用少量真实数据做校准。另一个手段是系统辨识先测量现实系统的参数再把这些参数注入仿真。比如测量真实机器人的关节摩擦、电机响应延迟然后在仿真里复现。这样仿真更接近现实迁移效果更好。6.4 在线学习中的分布偏移模型越学越偏怎么办在线学习听起来很美模型上线后持续学习越用越聪明。但实际做起来很容易出现分布偏移模型学到的策略改变了数据分布新数据又反过来影响模型形成正反馈循环最后模型越学越偏。举个例子推荐系统用决策模型做内容排序模型发现某类内容点击率高就拼命推这类内容。用户被这类内容包围点击行为进一步强化模型更确信这类内容好。最后推荐结果高度同质化用户流失。缓解分布偏移的方法有探索机制让模型偶尔尝试非最优动作保持数据多样性。比如ε-greedy策略以一定概率随机选择动作。重要性采样给不同分布的数据加权防止模型过度拟合当前分布。定期离线评估用固定的测试集评估模型监控性能是否下降。6.5 安全校验层的设计最后一道防线不能省决策模型直接控制物理设备一旦出错可能造成严重后果。所以安全校验层是必须的而且要做成独立模块不能和模型耦合。安全校验层通常包括硬约束检查比如关节角度不能超过机械限位车速不能超过限速。这些是绝对红线违反直接拦截。软约束检查比如加速度不能太大否则乘客不舒服。这些可以适当放宽但要有告警。异常检测模型输出和预期分布差异太大时触发回退策略。比如切换到规则控制器。人工接管复杂场景下安全校验层判断模型不可靠直接请求人工介入。安全校验层的设计原则是简单、可靠、可验证。不要用复杂的神经网络做安全校验用规则和查表就够了。因为安全校验层本身不能出错越简单越可靠。7. 我对这条路线的一些个人判断决策模型这条路线短期内不会像生成模型那样出圈因为它不产生“可展示”的内容。你没法拿一个决策模型的输出发朋友圈说“看它决定左转15度”。但它的价值恰恰在于此它不追求表面的惊艳而是追求在真实世界里稳定、可靠、高效地完成任务。从工程角度看决策模型的落地难度比生成模型高一个量级。生成模型可以容忍一定程度的幻觉和错误决策模型不行。生成模型可以慢慢推理决策模型必须实时响应。生成模型可以离线训练决策模型必须在线学习。这些约束决定了决策模型的开发周期更长、调试更痛苦、但一旦跑通壁垒也更高。Jev路线给我的最大启发是Token不一定要用来生成文本它可以是任何离散化的信息单元。状态、动作、奖励都可以Token化都可以用序列建模的方法处理。这个思路打开之后很多传统上被认为“不适合深度学习”的控制和决策问题都有了新的解法。如果你正在做AI落地我建议你认真评估一下你的场景里输出到底是内容还是动作如果是动作那生成模型可能不是最优解决策模型值得一试。当然前提是你有足够的数据、算力和耐心因为这条路线没有捷径每一步都得自己踩实。
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/10/10 8:59:51
Playwright v1.63 把 reporter 做成插件:同一批红灯终于不用写三套报告
2026/10/10 8:59:51
2026年大厂测试技术栈全景:从自动化到AI的质量工程进化
2026/10/10 8:54:47
跨境电商多语言客服知识库怎么建:资料结构、检索边界与人工升级
2026/10/10 10:40:35
一套完整的纵向微生物组方法体系长什么样?
2026/10/10 10:40:35
AI论文写作工具深度测评:从大纲生成到智能降重的完整实战记录
2026/10/10 10:40:35
自建埋点分析系统成本揭秘:自研、开源ClkLog与商业产品怎么选?
2026/10/10 10:40:35
Java面向对象实战:智能家居控制系统如何设计才能优雅可扩展
2026/10/10 10:40:35
双有源桥DAB扩展移相控制(EPS)原理与电压闭环实现
2026/10/10 10:35:34
CVDP基准实测:AI生成Verilog代码的能力边界与工程实践
2026/10/10 0:03:38
工业软件标准化路线图:国产替代的落地施工图
2026/10/10 0:03:38
VCMI安卓版实操指南:原生运行英雄无敌3的3步技术落地
2026/10/10 0:03:38
稀疏多通道盲反褶积的MATLAB算法实现与参数调优
2026/10/10 3:42:06
Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化
2026/10/10 3:42:01
多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系
2026/10/10 3:41:58
hindsight:面向LLM应用的事后可观测性工程实践
2026/10/10 3:41:56
我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
2026/10/10 3:41:54
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026/10/9 11:36:17
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)