26年8月来自Perception AI公司的论文“Isaac 0.5: Percepts Scale Control”。Isaac 0.5 是一个拥有 360 亿个参数的开放权重具身基础模型它将视频感知、具身视觉推理和机器人控制统一到一个稀疏骨干网络中。所有输出都来自同一个共享表示该模型通过一个基于骨干网络状态的专用 Flow 专家输出语言和接地输出、离散的 FAST 动作token以及连续动作。还引入了空专家null expert路由它允许每个token根据需要使用模型 256 个路由专家中的 0 到 8 个。Isaac 0.5 的独特之处在于其协同训练的规模和组成。远程操作提供直接的控制监督但每个可接受的小时数都需要占用一个机器人、一个操作员和特定任务的基础设施。视频成本更低、数据更丰富但缺乏机器人动作和本体感觉。为了从视频中学习Isaac 0.5 使用一种专有的自监督视频目标函数该函数根据先前的帧预测未来观测的语义内容。其将预测的与任务相关的可见状态和变化称为感知。其目标由视频自动构建无需人工标注或动作标签目标构建和损失函数的实现仍为专有技术。Isaac 0.5 联合训练未来感知预测、视频感知、具身视觉推理和控制。视频和自回归动作监督更新共享表征而连续动作则训练一个基于其状态的 Flow 专家。这是一个将通用无动作视频扩展到一百万小时并同时包含以自我为中心的视频、手持机械臂 (UMI) 视频和机器人数据的研究。在通用视频、以自我为中心的视频和 UMI 视频的固定比例为 80:30:30 的情况下将通用视频从 1000 小时增加到一百万小时使得经过良好校准的离线动作损失阈值对应的网格内远程操作交叉点从 5884 小时减少到 28 小时减少了 210.3 倍。相邻的测量远程操作阶梯将此比率限制在 83 到 300 倍之间。当与更多远程操作数据结合使用时额外的视频可以更有效地减少动作损失。其发布了超过 35 个训练实例的权重、推理和自适应代码、评估设置以及机器人特定的部署配置。。。。。。。继续。。。。。。在描述了模型及其训练数据之后现在来评估视频协同训练的价值。探究视频协同训练对达到校准良好的离线动作损失阈值所需的远程操作的影响程度。该评估采用双因素网格七个通用视频预算从 1,000 小时到 100 万小时不等与基于 2,000 小时到 10,000 小时通用支持范围的远程操作预算交叉每个单元格运行一次并嵌套视频子集。任务和实现方式均采用第 3 节中固定的评估设置而非进行更改。网格中的每次运行均使用前面的架构和目标并且已发布的 Isaac 0.5 检查点是网格中最高的视频预算点因此以下评估描述的是发布的方案而不是一项单独的研究。1 训练数据类型用四种类型的训练数据语料库组成和过滤在之前进行了描述。通用视频展示了外观、运动和语义变化但不包含产生这些变化的动作。以自我为中心的视频提供了第一人称视角的手部动作、接触情况和任务进度Grauman 等2022包括手部姿态数据可提供近似的人类手部运动。通用操作接口UMI式手持夹爪无需机器人即可记录夹爪的运动和时间但仅限于设备可执行的动作Chi2024。特定任务的远程操作成本最高它直接记录机器人指令、机器人状态、时间和结果。网格图显示通用视频与远程操作的对比。每个视频预算都包含被动式以自我为中心的视频流和 UMI 辅助视频流每个视频流在标记为 V 的点贡献 3V/8 小时称之为链接视频混合因为这三个视频流的规模是同步的。远程操作的成本独立变化。前面分析采用远程操作通用视频以自我为中心的视频流UMI 1:10:3.75:3.75 的比例。该组合保持了测得的 80:30:30 视频比例并为每个远程操作小时分配 10 小时的通用视频。网格提供损失响应前面将其与价格相结合以获得成本觉察的混合。2 测量设计设 V 为 80:30:30 混合比例下的通用视频小时数h 为可接受的特定任务远程操作小时数L(V,h) 为离线动作损失数值越低越好。V 和 h 的单位均为小时。L 是一个在固定设置下评估的单一保留动作目标并且在网格的每个单元格中保持不变因此网格内的损失具有可比性τ 以该目标的单位表示。比较仅依赖于这种不变性而不依赖于目标的选择。在每个固定的视频预算 V 下分别构建一个单调包络在每个远程操作阶梯上用在该阶梯或任何更低小时数阶梯上观察到的最低损失。阈值穿越采用以 log10 小时为单位的线性插值图 10A则在常见的 2 至 10,000 小时遥操作支持范围内以 log10 电压为单位应用相同的插值。因此每个穿越点和表面值都位于测量网格内。此外对于每个至少由五个视频预算表示的遥操作阶梯对原始损耗进行以 log10 电压为自变量的回归。图 10B中的这些阶梯斜率描述了观测到的网格。该网格每个单元格包含一次运行且视频子集是嵌套的因此不给斜​​率附加标准误差也不将其解读为因果效应。图 10C显示一个有界配方对比七次非感知运行每次运行对应一个视频预算训练时没有采用语义未来-感知目标。图 14 所示的物理国际象棋系统在一个循环中完成棋盘感知、走法选择和实际执行。图 13 明确地展示这种编排方式具身推理和 VLA 控制是同一个 Isaac 0.5 检查点的两种路由模式而不是单独部署的高级模型和低级模型。在每个回合开始时Isaac 0.5 从机器人的摄像头视图读取棋盘并重建当前位置。走法选择随后以两种预设模式之一运行。在闭环模式下模型从其学习的国际象棋知识中选择走法。在工具辅助模式下Isaac 0.5 通过其工具接口调用 Stockfish 并执行返回的走法。两种模式都终止于相同的类型边界一个精确的从源到目标的命令例如将兵从 e2 移动到 e4。选定的命令与当前的摄像头观测值和机器人状态一起不加任何转述地传递给 VLA 控制请求。控制路径将场景中指定的方块和棋子接地生成动作块并执行拾取和放置动作。随后新的观测结果开始下一回合。这种划分方式明确了策略边界启用后Stockfish 会选择一个移动但从不向机器人发出指令而 VLA 则始终接收精确的移动指令并执行其物理实现。在对 500 条人工采集的轨迹进行训练后所有尝试的基线策略均未能成功完成一次试验成功率均为 0%。注前面图 14 记录了最终的完整部署过程。衡量开放权重策略从一次迭代中获取特定任务控制并将其更新迁移到附近场景的难易程度。以固定机器人、棋盘、摄像头布置和动作界面的物理国际象棋操作任务为例来构建基准测试。国际象棋场景提供了一个可控的演进过程从重复的运动行为到指令控制的抓取和放置再到多步执行同时保持物体和工作空间在不同层级间的可识别性。前面图 14 展示共享的工作空间和同步的摄像头视图。该基准测试包含三个层级。在固定移动层级棋盘被重置机器人反复抓取同一枚棋子并执行相同的从源到目标的移动这隔离了抓取和运动适应能力。在符号控制层级指令以国际象棋坐标表示法指定任意的源和目标例如 e2-e4机器人必须识别并移动相应的棋子。在进攻路线层级机器人执行一条预设的进攻开局路线以及由先前移动选择的一组数量庞大但有限的分支变招。最后一个测试阶段旨在检验单回合适应性能否迁移到相关的多步序列中。它并不要求实现不受限制的国际象棋对弈或独立策略选择系统会提供棋路和合法分支评估的行为是它们的物理执行。每个阶段收集两个完整的专家回合分别记为 eA 和 eB。这对回合保留了机器人和动作的语义同时引入了可控的偏移对于固定走法棋子姿态或执行路径发生扰动对于任意的拾取放置棋子或棋盘状态的记谱法有所不同或者在同一进攻路线中引入不同的变化。评估两个方向首先在 eA 上进行微调然后在 eB 上进行测试之后恢复已释放的检查点在 eB 上进行微调然后在 eA 上进行测试。本次比较包括 π0.5、SmolVLA、MolmoAct2、GR00T N1.7 和 Isaac 0.5Black2025cSmolVLA2025Fang2026NVIDIA2026c。训练实现。对每个检查点在其原生训练栈中进行微调而不是在一个框架中重新实现每个模型。Isaac 0.5 使用与其预训练和发布微调相同的内部训练代码库和动作接口。对于 π0.5用 Physical Intelligence 的官方 OpenPI 训练流程Physical Intelligence2025对于 SmolVLA用官方的 Hugging Face LeRobot 实现SmolVLA 团队2025对于 MolmoAct2用已发布的 Allen Institute 训练库及其固定的 LeRobot 集成Fang2026。对于 GR00T N1.7用 NVIDIA 官方的 Isaac-GR00T 微调流程NVIDIA2026c。每次运行都固定代码版本、基准检查点标识符、软件环境、可训练参数集、优化器和学习率。一个共享transformer将相同的 10 Hz 国际象棋回合数据以各框架所需的数据集模式呈现并在加载后验证观测时间戳、动作顺序、单位和有效锚框的数量。每个原生训练器保留其已发布动作的目标函数和归一化路径但一个 epoch 始终意味着对这些已验证的锚框进行一次遍历不进行替换采样或重复短回合。在评估之前预测结果会从原生模型表示解码到通用基准动作空间。主要排名使用每个版本推荐的自适应模式仅在匹配接口敏感性分析中分别比较全参数和参数高效的结果。原生初始配置方案有意针对特定模型原生配置方案的比较将已发布的自适应接口视为被评估系统的一部分。保留推荐的可训练参数掩码、优化器族、峰值学习率、权重衰减、梯度裁剪、正则化和有效批次大小并将批次大小限制为 |Ie|以确保每个训练阶段都不会被重复样本填充。将观测值、状态和动作重采样到同一个 10 Hz 的控制网格上。每个有效的控制时间点都是一个动作锚点一个训练周期是对微调阶段中所有有效窗口进行一次随机遍历。相邻窗口重叠因此打乱顺序会改变优化顺序但不会使样本统计独立。每个策略都保留其原生动作目标和生成的块长度。评估使用每个块的前 Heval 10 个未来动作行对应于一秒更长的块仅在评分时进行裁剪。迭代策略使用其已发布的推理设置其中 π0.5 和 SmolVLA 使用 10 个流程步骤MolmoAct2 使用 8 个流程步骤。所报告的是所有其他基线所使用的设置而不是将流程步骤数等同于控制速率。训练一个感知-控制模型依赖于稳定的有效tokens供应。普通视频长度不一解码成本高昂。机器人轨迹虽然更短且结构化程度更高但其收集成本使得优化器在空闲跨度上花费的步骤显得尤为浪费。稀疏层进一步加剧了不平衡因为不同类型的tokens需要的路由工作量不同。从源头解决每个问题训练前进行类型化编译在输入管道中进行预测流式传输和独立解码在编码前进行视觉平衡在模型内部进行路由平衡以及在路由后进行压缩执行。图 16 展示了这些步骤的运行位置。此外工作进程返回的不仅仅是一个批次它预先计算了不依赖于前向传播的模型端张量包括多模态旋转位置、模态和角色掩码、每个动作的流上下文掩码以及 MFU 统计所需的每个模态的标记计数。因此训练步骤无需在前向传播和后向传播之间为这些张量付费。1 mHarmonymHarmony 是用于模型输入的强类型编译器。 mHarmony扩展OpenAI的开源Harmony渲染器和解析器而非引入另一种数据格式OpenAI2025。mHarmony将视频、文本、图像、状态、任务描述和动作转换为TensorStream事件并明确包含模态、时间、坐标、具身性和损失语义Perceptron Team2026。观察的动作与模型必须预测的动作保持分离这使得共享的主干网络能够基于通用视频、以自我为中心的交互、机器人感知和动作监督轨迹进行训练而无需将缺失的控制字段视为否定动作标签。2 序列打包mHarmony为每个文档发出一个事件流。排序器为文档 i 分配token长度 l_i、连续动作块数 a_i 和跳跃计数 s_i然后将其添加到工作队列 Q 中。当队列达到其文档限制 M、包含至少一个token的上下文窗口或旧文档达到重新打包阈值 S 时打包开始。每次打包过程都会对队列进行快照并按 l_i 递减的顺序对文档进行排序。超长文档会被拆分为 L 个tokens的前缀和后缀前缀立即打包后缀返回队列。然后该过程会访问已排序的文档一次。部分填充的bin b 会记录其已使用的token u_b 和动作块 c_b。过程结束后u_b/L ≥ ρ 的bins会被发出。在一个未填充bin中的文档跳跃计数会递增并返回队列 Q后续到达的文档可能会填满该bin。一旦 s_i ≥ S后续的每个到达都会触发另一次打包过程但 S 并不会强制未填满的bin发出数据。如果bin仅仅因为动作块限制而无法容纳其他方面兼容的文档则会被发出而不是重新排队。在输入结束时强制打包过程会发出剩余的bins。只有在选择bin进行发出后才会添加填充。每个bin内的文档顺序保持不变完整的文档保留其文档结束token这些tokens定义了可变长度的因果注意力片段因此打包后的文档不会相互关注。在完整的训练混合数据集上该算法会保留 2% 的tokens作为填充。打包保证。对于独立同分布 (IID) 的传入流bin分配在语义上是条件独立的在打包器可见的元数据条件下它不会在剩余内容中引入任何依赖性。因此所有偏离 IID 的情况都简化为该低维元数据的联合规律并且可以从打包轨迹中测量出来。对于固定的多重集和匹配的随机抽取打包和解包执行会产生相同的隐状态、掩码损失和参数梯度包括通过空路由移除、分组专家压缩和全局路由目标。强制刷新精确地保留幸存的单文档边缘分布但跳跃阈值和最佳匹配分配都不能保证较小的联合独立同分布距离。3 可靠的视频输入Rust 调度器使用每个工作节点的未来样本顺序来规划节点级共享内存中的分片下载、缓存创建和驱逐。节点一致性重标记relabeling0在将云样本重写为节点本地块的同时保留了计划的槽slot结构因此同一节点上的工作节点请求相同的分片并且每个分片只获取一次。间隔较长的重复访问拥有各自的缓存生命周期。这样可以避免视频密集型混合数据集将远程存储延迟转化为优化器空闲时间。仅凭缓存命中率无法体现这一点因此测量完整训练混合数据集下的端到端数据等待时间。视频解码运行在与其数据加载器工作进程分离的独立进程中。超时、编解码器错误和致命的解码器故障包括在 FFmpeg 中观察到的段错误只会终止解码器子进程监督进程会启动一个干净的子进程工作进程会继续运行。空间变换和 TensorStream 组装不在此故障边界内。长时间的测试会统计解码片段、替换片段和未恢复的故障并按编解码器测量延迟以及优化器等待输入所花费的时间比例。仅对具有已验证空闲信号的机器人源压缩长时间静止跨度。源特定的阈值和最小持续时间会移除持续空闲运行的内部区域同时保留短暂的暂停和过渡边界。验证集包括保持、稳定和接触丰富的运动因为视觉上静止的末端执行器仍然可以携带控制信息。数据记录将记录的机器人运行时间和优化器消耗的机器人运行时间分开。4 分布式视觉平衡经过时间采样和补丁处理后视觉示例包含不同数量的tokens。在每个步骤中本地视觉平衡会根据当前每个秩的块大小重新计算一个正则化的最优传输方案。其传输成本倾向于本地 NVSwitch 域内的分配从而限制速度较慢的跨域流量。最终方案会在编码之前将整个视觉块跨数据并行秩移动从而在不改变示例内容的情况下减少滞后样本。全局路由器平衡在token路由之后执行用于规范专家资源的聚合使用并且仅在不同秩之间交换分配统计信息token路由保持在本地。图 17 对比了这两种情况。分别测量编码前的视觉- token不平衡以及路由后的专家-分配分散。5. 实现空路由的稀疏执行空专家路由会改变执行的多层感知器MLP即使路由器仍然返回固定的前 8 个决策。内核将实际分配压缩成连续的前缀并将空后缀排除在分组矩阵乘法之外因此编译形状保持不变而实际专家调用次数则随token变化。连续的 Flow/DiT 路径具有不同的执行图并且单独编译。在线性注意力模块中与 MoE 兼容的 GDN 融合将归一化与输入投影相结合而不会改变路由器分数或专家分配Yang2025b。有界融合token损失避免为异常大的打包批次去创建词汇表大小的中间体。观察的分配。空路由与任务和阶段密切相关图 18所示。提示分配在不同任务之间差异很大而解码token始终使用几乎所有八个实际专家槽slot位。单独的视频评估显示相同的提示/解码划分。这些计数衡量的是路由式 MLP 调用次数而非端到端 FLOP 或延迟。经过三轮评审检查 142 个候选渲染图并选出 16 张局部对比度最清晰图图 19所示。在这些示例中高度零散的上下文围绕着可识别的低零散结构例如飞机、人物、滑雪者、几何和科学图表以及包含答案的文档区域。这些地图展示路由式计算分配实际路径较少的区域接收到的专家 MLP 更新也较少而其残差流表示则继续在层堆栈中传递。在一个预先注册的 512 个样本配对干预实验中强制解码器第 3 至 39 层中的两个顶角图像标记仅采用零路径使任务平衡的官方得分相对于假干预降低了 0.227 个百分点固定队列的 95% 自助法置信区间为 [-2.205, 1.742] 个百分点。结果未通过部署安全门因此夹具未展开或部署。7. 优化的两阶段推理在单个加速器上以两个共置的 vLLM-Omni 阶段来提供策略。第一阶段通过骨干网执行一次多模态预填充并返回最终归一化后的隐藏状态。第二阶段运行 0.58B DiT基于这些状态进行条件化应用 10 次欧拉更新并返回一个动作块。转换携带完整的前缀激活和动作上下文可见性掩码。因此前缀缓存是执行契约的一部分如果没有合并的前缀动作专家将只会收到最终的隐藏状态行而不是观察上下文。机器人进程拥有控制时钟、动作队列和随机数流。每个请求包含原始 uint8 相机帧、机器人单元中的本体感觉、任务提示、锚点时间戳、显式流噪声以及自上一个请求以来已执行的动作行。这些执行的行有两个用途它们固定实时分块前缀并提供因果动作历史记录。服务器验证有效载荷摘要通过 mHarmony 渲染请求规范化状态并运行这两个阶段。它返回一个规范化的动作块客户端将其转换为机器人单元一次。将渲染和规范化操作保留在进程边界的同一侧使得提供的输入可以根据训练契约进行审计并避免通过网络传输内部 TensorStream 对象。图 21 显示最终的服务路径及其在机器人控制回路中的位置。