首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
DENSE:将智能体轨迹提炼为面向自我改进的证据驱动捷径树
📅 2026/9/25 20:04:59
✍️ 爱科研究院
👁 阅读 3,247
DENSE:将智能体轨迹提炼为面向自我改进的证据驱动捷径树arXiv编号:arXiv:2609.21423v1 [cs.AI]摘要线上部署的大模型智能体会产出海量执行轨迹,但任务专属验证器、专家标注成本高昂,难以大规模获取。本文研究:在没有事后任务结果标签的前提下,如何从原始轨迹中提炼可复用反馈信息,利用轨迹内部的局部进展、故障恢复、未完成需求等证据。提出DENSE(Distilling Evidence from Nested Subtask Executions,从嵌套子任务执行中提炼证据),将轨迹证据组织为证据驱动嵌套捷径树。DENSE压缩冗余尝试,利用恢复证据跨层级调和各类问题;对已完成分支做摘要,同时对未解决分支做展开;把可复用进展与剩余待完成义务建立关联。本文同时提出REFIT评测协议:源轨迹配对评测,在看不到事后任务结果标签的条件下对比不同反馈;重置环境与模型上下文,使用反馈对同一任务重新发起尝试。在Terminal‑Bench 2.1基准上,DENSE在四款被测接收模型上,在所有非特权反馈方法中取得最高严格通过率。相对原始首轮执行,严格通过率提升7.12‑15.64个百分点;重跑时接收方模型token观测消耗降低19.0‑43.6%。基于GPT‑5.5的消融实验证实:嵌套子任务分析、捷径构建、问题调和三者组合才能拿到完整增益。实验表明,可以依靠证据驱动的轨迹复用来实现智能体自我迭代,降低对外部监督的依赖。关键词智能体轨迹蒸馏;自我改进;嵌套子任务;捷径树;无标签反馈;REFIT协议;Terminal‑Bench目录引言DENSE:证据驱动的捷径树2.1 问题设定与总览2.2 构建嵌套子任务2.3 带证据的尝试过程压缩2.4 通过恢复证据调和问题2.5 渲染未完成需求义务REFIT:评估轨迹信息价值3.1 配对重跑实验3.2 可用信息定义3.3 下游效用指标实验4.1 实验设置4.1.1 任务4.1.2 接收方模型4.1.3 执行配置4.1.4 反馈生成模型4.1.5 评测指标与覆盖率4.2 对比方法4.3 任务性能结果4.4 消融实验
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/25 20:04:59
动漫资源导航站搭建实战:从分类设计到链接自动检测的轻量方案
2026/9/25 20:04:59
Claude Code Skill 一句话生成 HTML 幻灯片:原理、实操与进阶技巧
2026/9/25 20:04:59
图像数据集扩充增广工具 AI图像数据增强工具
2026/9/25 20:55:02
2026避坑指南 实测好用的AI论文网站 符合学术规范不拼凑
2026/9/25 20:55:02
Linux下 HTTPS协议原理
2026/9/25 20:55:02
KytyPS5加载器深度解析:如何逆向PS5 ELF64格式与运行时动态链接的完整指南
2026/9/25 20:55:02
firewalld: 各个zone的用途
2026/9/25 20:55:02
2026年“华为杯”第二十三届中国研究生数学建模竞赛“E题:复杂场景下多模态情感识别的数学建模与算法设计”思路解析+实现代码+论文撰写+摘要+最终论文
2026/9/25 20:50:02
如何用treg路由端点(treg.capability)让平台自动选供应商?
2026/9/25 0:03:37
AI元人文:从工具使用到思维重构的深度探索
2026/9/25 0:03:37
Python+CNN车牌识别实战:从数据预处理到模型训练与部署
2026/9/25 0:03:37
Vim基础操作全攻略:保存退出、模式切换与高频命令实战
2026/9/25 5:41:44
深入解析Transformer多头注意力机制与工程优化
2026/9/25 5:41:44
OpenClaw 的 Skills 跑学习任务,模型通道改到 TaoToken 通道行不行?
2026/9/25 5:41:44
ChatGPT报错Oops, an error occurred! 全链路排查指南