首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
EvoOntology: A Self-Evolving Ontology Layer for Data Agents——面向数据智能体的自演化本体层
📅 2026/10/6 16:05:42
✍️ 爱科研究院
👁 阅读 3,247
一、研究背景与核心问题数据智能体Data Agents旨在完成面向异构数据表格、CSV、文档、数据库、图表等的自然语言任务。智能体必须持续与外部数据源交互才能收集生成最终答案所需的信息。然而现实部署中存在一个根本性挑战——智能体—数据鸿沟Agent-Data Gap数据以关系数据库、半结构化文件和文本文档的形式存在于智能体之外智能体只能通过 SQL 接口、文件读取器等通用工具访问数据数据源的结构和内容无法先验获知智能体不得不通过反复探测查询、猜测概念位置、检查无关内容来盲目探索导致重复低效的探索。弥合这一鸿沟需要一个中间本体层显式表示领域概念、将概念锚定到底层数据、使智能体能在语义层面而非物理层面与数据交互。二、现有方法的不足论文将现有智能体—数据交互方法分为两类并指出其局限方法类型代表工作主要问题原始查询Raw QueryingDIN-SQL、MAC-SQL、CHESS 等对小型简单数据源有效但难以扩展到宽表异构数据智能体易陷入重复低效探索语义层Semantic LayerHitzler 2021、dbt Labs 2023、Feng et al. 2024 等① 整个语义层无法塞入有限上下文② 通常预定义且人工维护构建成本高③ 无法适应不同智能体行为关键洞察静态语义层作为提示片段注入上下文时会与智能体其他指令竞争无法逐轮修剪而 EvoOntology 通过 MCP 工具让智能体主动按需查询仅检索当前步骤相关的术语和映射。三、EvoOntology 的核心设计EvoOntology 是一个自演化本体层封装为MCP 服务器包含三个层次1. 内容层Content Layer, St类型化语义图包含四个节点族术语Terms领域概念、映射Mappings锚定到字段和链接路径、约束Constraints管理有效使用、证据Evidence支持语义主张两个边族语义关系关联、层次、组合、等价、派生、结构引用连接术语到映射、附加约束和证据2. 模式层Schema Layer, Γt定义四个节点族的字段、可允许的语义关系类型、允许的引用模式。模式更新可扩展本体的表示能力而不改变已实例化内容。3. 工具层Tool Layer, Rt通过两个 MCP 工具和一个会话清单暴露本体fbrowse(q,k,n)检索查询 q 和类型 k 的前 n 个语义匹配项fresolve(I,c)返回请求的记录及其链接对象清单Manifest唯一放入提示词的本体内容提供紧凑的源和使用信息详细记录按需检索四、两大核心机制机制一基于证据的本体初始化Builder Agent工作负载引导的探测从训练工作负载 W 中提取反复出现的实体、指标、操作和分析条件生成候选概念 C对每个候选发出探测查询识别候选字段和链接路径检查类型、值和语义一致性。基于证据的提交仅提交通过验证类型、过滤器、值分布要求的候选支持记录保留为证据形成初始状态 L0(S0,Γ0,R0))。关键设计每个提交条目必须锚定在探测查询上而非仅自然语言描述。机制二基于轨迹的本体演化Evolution Agent四步演化循环诊断Diagnose从历史轨迹 Tt 和当前状态 Lt 中提取反复出现的交互签名 Σt。归因Attribution将签名归因到内容C、工具T或模式S层级并说明预期行为效果。补丁Patch提出局部化干预每个候选仅修改一个层级内容干预增删改语义对象工具干预修改工具集模式干预修订对象模型。门控Gate骨干条件配对验证——候选与父代在相同验证集、相同解码和交互预算下评估仅当改进达到边际 τ 时才保留关键设计单层级差异隔离归因假设被拒绝候选的签名、干预和评估结果被记录以避免重复无效更新所有骨干从相同初始状态独立演化允许骨干特定交互模式。五、实验设计与主要结果基准与设置三个基准DDR-Bench10-K 场景开放式数据研究、InsightBench商业分析洞察挖掘、BIRD文本到 SQLOracle Knowledge 设置六个骨干GPT-5.5、GPT-5.6-sol、Claude-Sonnet-5、Claude-Opus-4.8、DeepSeek-V4-Flash、Qwen3.5-Flash两个基线Baseline无本体 ReAct、Baseline SL静态语义层提示互惠两折评估每基准分 A/B 两折70% 用于构建/演化/候选生成30% 用于配对验证反转折后取平均防止信息泄露主要结果基准指标主要发现DDR-Bench轨迹级准确率六个骨干全部提升平均17.8 分GPT-5.5 提升最大26.7Baseline SL 在 Claude-Sonnet-5 上反而下降 15.0 分InsightBench洞察/摘要所有骨干提升平均1.9 分DeepSeek-V4-Flash 提升最大6.1BIRDEX/VES所有骨干双指标提升平均7.4 / 8.6 分Baseline SL 出现 EX 下降但 VES 上升的混合模式与记忆基线对比ReAct Memory 将轨迹级从 69.5 提升到 75.8但仍比 EvoOntology89.5低 13.7 分——片段记忆仅重放已做过的事不暴露类型化可组合结构。六、深入分析的关键发现1. 本体层的效果分解Initial构建器本体DDR-Bench 轨迹级平均 12.3 分BIRD EX 5.1 分Evolved自演化后DDR-Bench 再 7.7 分BIRD EX 再 3.7 分结论构建器提供有效起点自演化循环对实现全部增益至关重要2. 迭代演化效果四个骨干均从 Initial 单调改进至收敛GPT-5.6-sol 五轮后达 93.5Claude-Opus-4.8 四轮后达 92.3最后两轮趋于平坦与失败签名变罕见一致结论增益是收敛精炼的结果而非单一幸运补丁3. 演化循环消融禁用步骤轨迹级下降w/o Gate-11.2最大w/o Attribution-6.3w/o Diagnose-4.8w/o Patch自由形式-1.7门控和归因是承重部件验证了演化循环比迭代更具选择性的设计。4. 三层演化消融变体轨迹级增益仅工具演化13.2最大单层仅内容演化8.7仅模式演化3.6完整三层20.0三层互补且不可替代。5. 本体结构消融屏蔽对象族轨迹级下降w/o Mappings-13.4最大w/o Evidence-8.7w/o Constraints-3.5w/o Relations-2.1映射和证据是承重族验证了每个提交条目必须锚定在探测查询的设计。6. 跨骨干差异已接受术语标识符的成对 Jaccard 重叠无一超过 0.62两个 Claude 骨干间共享0.55少于两个 GPT 骨干间0.61跨骨干迁移实验中对角线一致为列最高非对角线至少下降 6.6 分结论不同骨干从相同初始化产生不同演化存储骨干特定演化是有益的7. 内容层增长与成本增长大多数内容增长发生在前三轮三轮后每轮各元素增长低于 5%术语从 61 增至 80五轮后成本Initial 本体使每轮输入 token 从 3.2K 增至 4.1K但轨迹从 14.6 轮缩短至 11.2 轮总 token 从 52.6K 降至 50.4KEvolved 进一步降至 8.4 轮和 42.0K token比 Baseline 低约 20%同时轨迹级从 69.5 升至 89.58. 归因分布工具级编辑占累计增益57%6 轮主导杠杆内容级编辑占34%11 轮更频繁模式级编辑占9%3 轮较少见但解决无法通过修改实例化内容解决的问题9. 案例研究卡牌合法性语义演化以文本到 SQL 中识别目标游戏格式中被禁卡牌为例初始状态包含 Card 和 Legality 术语及关联但未解释legalities.status值含义也未明确合法性状态相对于特定游戏格式归因限制内容层——现有 browse/resolve 工具已可检索相关对象模式层可表示所需知识缺失的是状态字段的可复用语义描述及其适用条件局部干预新增 Legality Status Code 术语锚定到legalities.statusEvidence 记录状态值分布Constraint 声明识别被禁卡牌需同时满足legalities.status Banned和legalities.format target_format效果browse 可浮现 Legality Status Coderesolve 可获取物理映射、支持证据和格式依赖约束SQL 执行仍负责应用过滤和验证记录意义演化可通过添加小型连接对象集纠正特定语义缺口本体保留现有结构和接口七、结论与贡献核心贡献提出EvoOntology——面向数据智能体的自动构建、自演化交互式本体层将本体封装为MCP 服务器智能体运行时主动查询而非静态提示注入设计四步演化循环诊断→归因→补丁→门控通过归因引导的类型化编辑和骨干条件配对评估门控精炼本体在三个基准、六个 LLM 骨干上一致优于ReAct 基线和传统语义层基线核心价值有效弥合智能体—数据鸿沟使数据智能体能够以语义层面而非物理层面理解异构数据同时通过演化循环降低总 token 成本、提升任务准确率。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要数据智能体旨在完成面向异构数据包括表格、文件和数据库的自然语言指令。然而数据智能体面临一个具有挑战性的智能体—数据鸿沟异构数据位于智能体之外而智能体只能通过通用工具访问这些数据例如列名和文件路径。现有方法要么让智能体直接探索原始数据源要么将人工构建的语义层注入提示词中。然而这两种方法都难以扩展到大规模异构数据源也无法适应不同的智能体行为。本文提出EvoOntology一种面向数据智能体的自演化本体层。EvoOntology 将本体封装为一个 MCP 服务器包含模式层、内容层和工具层使智能体能够在运行时主动查询并与本体交互。为此我们引入了一个用于自主构建本体的构建器智能体以及一个自演化循环通过归因引导的类型化编辑持续精炼本体且仅在经过骨干条件配对评估后才接受这些编辑。在三个广泛采用的数据智能体基准上、使用四个 LLM 骨干进行的实验表明EvoOntology 始终优于强基线和现有语义层方法有效弥合了智能体—数据鸿沟并实现了与异构数据更有效的交互。引言面向异构数据的数据智能体Liu et al. 2026; Sahu et al. 2025; Li et al. 2023; Hong et al. 2025; Zhang et al. 2023a旨在解决同时涉及结构化数据例如表格和数据库与非结构化数据例如文档和文件的自然语言任务。为完成此类任务智能体必须持续与异构数据源交互以收集生成最终答案所需的信息。近年来大语言模型LLM工具使用方面的进展Yao et al. 2022; Schick et al. 2023; Qin et al. 2023; Patil et al. 2024使智能体能够直接访问和操作外部数据源为此类数据交互提供了基础。然而与异构数据的直接交互引出了一个根本问题数据智能体能否有效理解异构数据在实际部署中数据以关系数据库、半结构化文件和文本文档的形式存在于智能体之外而智能体只能通过 SQL 接口和文件读取器等通用工具访问数据。一个根本性挑战在于这些异构数据源的结构和内容都无法先验获知。结果智能体不得不通过反复发出探测查询、猜测所需概念所在位置并检查可能无关的内容来盲目探索底层数据。这种不匹配造成了持续存在的智能体—数据鸿沟。弥合这一鸿沟需要一个中间本体层它显式地表示领域概念、将概念锚定到底层数据并使智能体能够在语义层面而非物理层面与数据交互。图 1自演化本体层帮助数据智能体理解异构数据。现有的智能体—数据交互方法大致可分为原始查询和基于语义层的交互两类。原始查询方法Pourreza and Rafiei 2023; Wang et al. 2025; Talaei et al. 2024允许智能体直接检查模式并对底层数据发出探索性查询。虽然对小型且相对简单的数据源有效但它们难以扩展到宽表异构数据智能体很容易陷入重复且低效的探索。相比之下语义层方法Hitzler 2021; dbt Labs 2023; Feng et al. 2024; Chang and Fosler-Lussier 2023提供元数据包括模式、实体、指标和其他领域语义以指导智能体。然而由于上下文长度限制将整个语义层纳入智能体上下文对于大型数据源而言并不现实。此外现有语义层通常是预定义且人工维护的构建成本高昂图 2EvoOntology 概览。它包含一个类型化内容图、其对象模式以及一个运行时工具接口。构建器构建一个基于证据的初始状态而演化智能体则从历史交互轨迹中精炼该状态。内容层。内容层 St 是一个类型化语义图包含四个节点族和两个边族。节点族包括术语Terms、映射Mappings、约束Constraints和证据Evidence。术语表示领域概念映射将术语锚定到字段和链接路径约束管理术语的有效使用证据支持术语的语义主张。边族包括语义关系Semantic Relations和结构引用Structural References。语义关系通过关联、层次、组合、等价或派生连接术语。结构引用将术语链接到映射并将约束和证据附加到它们所管理或支持的对象上。图 2 通过一个财务分析示例说明了这些组件。基于证据的本体初始化为每个数据源手动定义领域概念、字段映射、链接路径和语义约束需要大量专家工作。构建器智能体从训练工作负载和原始源构建初始本体而不观察金标准答案。工作负载识别与智能体相关的语义而可执行探针验证它们在底层数据中的锚定。基于轨迹的本体演化仅靠数据锚定并不能确保本体适合特定智能体。因此EvoOntology 使用历史轨迹作为行为证据。成功的执行揭示了有效的语义结构和访问模式而不成功的执行则暴露了缺失、误导或暴露不良的组件。实验基准我们在三个具有异构模态和答案格式的数据智能体基准上评估 EvoOntology。所有评估均遵循每个基准的官方评估协议。Deep Data ResearchDDR-BenchLiu et al. 2026评估跨异构源的开放式数据研究。我们在 10-K 场景上评估并报告逐轮解释的消息级准确率Message-Wise accuracy和全历史综合的轨迹级准确率Trajectory-Wise accuracy。InsightBenchSahu et al. 2025是一个商业分析基准由商业智能标志组成每个标志配有一个 CSV 数据集和一个分析师应揭示的金标准洞察。我们报告洞察Insight和摘要Summary得分。BIRDLi et al. 2023是一个文本到 SQL 基准针对真实世界数据库上的自然语言问题在官方 Oracle Knowledge 设置下评估。SpiderYu et al. 2018; Lei et al. 2025等后续基准将该设置扩展到多模式和企业工作流。主要指标是执行准确率Execution Accuracy, EX次要指标是有效效率得分Valid Efficiency Score, VES。实验设置骨干模型。我们在六个 LLM 骨干上评估 EvoOntologyGPT-5.5、GPT-5.6-sol、Claude-Sonnet-5、Claude-Opus-4.8、DeepSeek-V4-Flash 和 Qwen3.5-Flash。对于每个骨干所有条件均使用相同的 ReActYao et al. 2022脚手架、原始数据工具、解码配置和交互预算。评分遵循每个基准的标准评估协议Li et al. 2023; Sahu et al. 2025; Liu et al. 2026。基线。我们在相同的 ReAct 脚手架和骨干下将 EvoOntology 与两个基线进行比较。Baseline运行不带任何本体层的 ReAct因此智能体必须在每个任务中重新发现模式和领域词汇。Baseline SL将构建器智能体的语义层作为静态提示片段前置到智能体上下文中Cao et al. 2024; Caferoglu and Ulusoy 2024; Li et al. 2024b; Chang and Fosler-Lussier 2023。这种互惠设计遵循两折交换评估Dietterich 1998; Wang et al. 2026。所有方法使用相同的折分配和部署配置。相同的适应折用于所有相关条件下的本体构建和更新。留出折仅在最终评估时访问且在本体冻结之后其答案和评估器反馈从不用于本体构建、演化或候选选择。主要结果多源数据研究能力。表 1 报告了 DDR-Bench 在六个 LLM 骨干上的结果。EvoOntology 在所有六个骨干上均提升了轨迹级准确率相对于 Baseline 平均提升 17.8 分。提升范围从 Qwen3.5-Flash 上的 4.8 到 GPT-5.5 上的 26.7表明本体在基线能力差异显著的骨干上仍然有效。相比之下Baseline SL 将语义层作为静态提示注入上下文并未始终优于无中介智能体甚至在 Claude-Sonnet-5 上下降了 −15.0 分。Baseline SL 与 EvoOntology 之间的差距源于层被使用的方式静态提示片段与智能体的其他指令竞争且无法逐轮修剪而 EvoOntology 通过 MCP 工具暴露相同内容智能体主动查询这些工具仅检索与当前步骤相关的术语和映射。我们额外与ReAct MemoryShinn et al. 2023; Wang et al. 2023; Madaan et al. 2023进行比较后者将过去轨迹存储为可检索的片段。如表 2 所示基于记忆的持久化将轨迹级从 69.5 提升到 75.8但仍比 EvoOntology 低 13.7 分因为片段记忆仅重放已经做过的事情而不暴露类型化的、可组合的结构。表 1DDR-Bench 10-K 场景的主要结果。括号内报告相对于 Baseline 结果的增益。方法骨干消息级%轨迹级%总体%Reported ReActClaude-Sonnet-4.577.660.669.1DeepSeek-V3.260.138.249.2GLM-4.660.336.048.2GPT-5.244.941.143.0GPT-5-mini46.837.142.0Kimi-K251.130.840.1GPT-5.137.144.340.7Gemini-3-Flash44.821.233.0Baseline无本体的 ReActGPT-5.560.664.262.4GPT-5.6-sol64.068.566.3Claude-Sonnet-574.372.573.4Claude-Opus-4.874.073.073.5DeepSeek-V4-Flash26.230.328.2Qwen3.5-Flash16.414.315.4Baseline SLReAct 语义层GPT-5.558.4 (-2.2)63.9 (-0.3)61.2 (-1.2)GPT-5.6-sol62.5 (-1.5)65.5 (-3.0)64.0 (-2.3)Claude-Sonnet-565.6 (-8.7)57.5 (-15.0)61.5 (-11.9)Claude-Opus-4.865.9 (-8.1)71.4 (-1.6)68.6 (-4.9)DeepSeek-V4-Flash28.8 (2.6)31.7 (1.4)30.2 (2.0)Qwen3.5-Flash14.8 (-1.6)13.3 (-1.0)14.1 (-1.3)EvoOntologyGPT-5.574.0 (13.4)90.9 (26.7)82.5 (20.1)GPT-5.6-sol78.2 (14.2)93.5 (25.0)85.9 (19.6)Claude-Sonnet-578.4 (4.1)81.3 (8.8)79.9 (6.5)Claude-Opus-4.878.0 (4.0)92.3 (19.3)85.2 (11.7)DeepSeek-V4-Flash37.5 (11.4)52.3 (22.0)44.9 (16.7)Qwen3.5-Flash21.1 (4.7)19.1 (4.8)20.1 (4.8)在所有骨干上的总体性能平均增益为 1.9 分最大提升在 DeepSeek-V4-Flash 上6.1。增益小于 DDR-Bench因为 Insight 根据简短参考式发现进行评分一旦答案与参考对齐便饱和。Baseline SL 在 InsightBench 上恢复了大部分 Insight 增益但在 Claude-Sonnet-5 Summary 上下降了 −3.3而 EvoOntology 通过可查询工具而非静态提示暴露相同内容在所有四个骨干上同时提升了 Insight 和 Summary。数据检索能力。表 4 报告了 BIRD 在 Oracle Knowledge 下六个骨干上的结果。EvoOntology 为每个骨干提升了 EX 和 VES平均增益分别为 7.4 和 8.6 分。两个指标上的一致增益表明本体同时提升了查询正确性和执行效率。Baseline SL 呈现混合模式EX 最多下降 −5.6GPT-5.5而 VES 在所有骨干上上升表明静态语义层改善了 SQL 良构性但分散了生成正确查询的注意力。一旦相同内容通过智能体主动查询的 MCP 工具暴露并由演化循环精炼EvoOntology 便恢复了 EX 增益并在每个骨干上稳定优于两个基线以及先前的文本到 SQL 系统Pourreza and Rafiei 2023; Wang et al. 2025; Talaei et al. 2024。表 2在 DDR-Bench 上与基于记忆的持久化基线的比较跨四个骨干平均。“ReAct Memory”将过去轨迹存储为可检索片段并将前 k 个注入提示词。方法轨迹级%↑ΔBaselineReAct69.5-ReAct Memory75.86.3EvoOntology89.520.0表 3InsightBench 主要结果节选。方法骨干洞察%↑摘要%↑总体%↑Pandas AgentGPT-4o54.040.047.0AgentPoirotGPT-3.5-turbo50.031.040.5AgentPoirotGPT-4-turbo56.035.045.5AgentPoirotLlama-3-70B52.033.042.5AgentPoirotGPT-4o60.044.052.0BaselineReActGPT-5.552.947.650.3GPT-5.6-sol51.649.450.5Claude-Sonnet-553.351.352.3Claude-Opus-4.854.949.952.4DeepSeek-V4-Flash45.034.639.8Qwen3.5-Flash37.526.231.9Baseline SLGPT-5.553.4 (0.5)48.6 (1.0)51.0 (0.8)GPT-5.6-sol51.3 (-0.3)50.8 (1.4)51.1 (0.6)Claude-Sonnet-553.5 (0.2)48.0 (-3.3)50.8 (-1.6)Claude-Opus-4.855.8 (0.9)50.5 (0.6)53.2 (0.8)DeepSeek-V4-Flash47.0 (2.0)36.5 (1.9)41.8 (2.0)Qwen3.5-Flash39.0 (1.5)25.2 (-1.0)32.1 (0.2)EvoOntologyGPT-5.553.4 (0.5)48.6 (1.0)51.0 (0.8)GPT-5.6-sol53.2 (1.6)50.9 (1.5)52.1 (1.6)Claude-Sonnet-554.4 (1.1)51.5 (0.2)53.0 (0.7)Claude-Opus-4.855.8 (0.9)50.5 (0.6)53.2 (0.8)DeepSeek-V4-Flash49.2 (4.2)42.6 (8.0)45.9 (6.1)Qwen3.5-Flash39.3 (1.8)27.6 (1.4)33.4 (1.6)本体层的效果为区分构建器构建的本体贡献与自演化带来的额外增益我们比较三种设置Baseline、Initial和Evolved。Baseline 不使用本体层Initial 使用构建器智能体在演化前构建的本体Evolved 使用自演化后的最终本体。图 3 报告了每种骨干在三种设置下的性能。为总结总体趋势我们对每个基准和设置跨四个骨干平均主要指标得分并比较所得均值。初始本体相对于无本体基线建立了显著改进而自演化在所有三个基准上持续扩展了这一增益。在 DDR-Bench 上平均轨迹级得分从 Baseline 到 Initial 增加了 12.3 个百分点随后从 Initial 到 Evolved 又进一步提升了 7.7 个百分点。表 4Oracle Knowledge 下 BIRD 的主要结果。VES 以 0-100 分报告。括号内报告相对于相应 Baseline 结果的增益。方法骨干EX%↑VES%↑GPT-4GPT-446.4-DIN-SQLGPT-450.758.8DAIL-SQLGPT-454.856.1TA-SQLGPT-456.2-MAC-SQLGPT-457.658.8MCS-SQLGPT-463.4-CHESSGPT-4o65.062.8Baseline无本体的 ReActGPT-5.561.563.4GPT-5.6-sol63.565.6Claude-Sonnet-561.963.7Claude-Opus-4.867.569.6DeepSeek-V4-Flash33.136.4Qwen3.5-Flash46.547.9Baseline SLGPT-5.555.9 (-5.6)67.7 (4.3)GPT-5.6-sol63.0 (-0.5)68.9 (3.3)Claude-Sonnet-560.8 (-1.1)65.8 (2.1)Claude-Opus-4.866.2 (-1.3)75.0 (5.4)DeepSeek-V4-Flash36.3 (3.2)37.2 (0.7)Qwen3.5-Flash48.0 (1.5)51.9 (4.0)EvoOntologyGPT-5.568.9 (7.4)71.1 (7.7)GPT-5.6-sol70.7 (7.2)73.0 (7.4)Claude-Sonnet-571.8 (9.9)74.1 (10.4)Claude-Opus-4.878.3 (10.8)80.5 (10.9)DeepSeek-V4-Flash39.4 (6.4)44.1 (7.6)Qwen3.5-Flash49.1 (2.5)55.2 (7.3)首先增加了 0.8 分然后通过演化又增加了 0.2 分。在 BIRD 上平均 EX 得分随初始本体提高了 5.1 个百分点演化后进一步提高了 3.7 个百分点。这些结果表明构建器构建的本体提供了有效的起点而自演化循环对于实现全部性能增益至关重要并持续将本体改进到超出其初始状态。分析为更好地理解 EvoOntology 优势的来源和行为我们进行了一系列深入分析。除非另有说明本节所有分析均在 DDR-Bench 上跨四个骨干GPT-5.5、GPT-5.6-sol、Claude-Sonnet-5、Claude-Opus-4.8进行。迭代演化的效果为评估观察到的增益是否通过许多小编辑累积而非坍缩为单轮我们绘制了部署智能体在 DDR-Bench 上跨已接受演化轮次序列的主要得分。每轮对应一个通过配对门控的候选父代线追踪如果不运行更多轮次将保留的本体版本的得分。如图 4 所示所有四个骨干从 Initial 到已接受轮次均单调改进GPT-5.6-sol 在五个已接受轮次后达到 93.5 轨迹级Claude-Opus-4.8 在四个轮次后达到 92.3。值得注意的是轨迹在最后两轮趋于平坦这与一旦本体覆盖了反复出现的跨文件概念失败签名变得罕见一致。结果表明表 1 中报告的增益是收敛精炼的结果而非单一幸运补丁这验证了四步演化循环的设计。图 3三个基准在三种条件下的主要指标Baseline、Initial 和 EvolvedEvoOntology。图 4三个基准上跨已接受演化轮次的主要指标DDR-Bench 上的轨迹级、InsightBench 上的 Insight 和 BIRD 上的 EX。演化循环的消融研究通过依次禁用四个步骤诊断、归因、补丁、门控并比较所得最终 Evolved 得分在 DDR-Bench 上跨四个骨干的平均值评估演化循环中四个步骤的相对贡献。每个步骤的禁用变体为w/o Diagnose跳过失败轨迹聚类步骤要求演化智能体从最近轨迹的随机样本中提出编辑w/o Attribution丢弃层级标签允许智能体在任意层级提交编辑而不陈述假设w/o Patch阶段用演化智能体直接从诊断产生的自由形式本体重写替代类型化的、假设条件化的编辑w/o Gate接受每个候选补丁。如表 5 所示移除门控导致最大下降-11.2 轨迹级因为未过滤的候选引入了下一轮无法总是撤销的回退。移除归因步骤下降 -6.3因为没有层级标签循环在失败是清单问题时倾向于进行内容编辑反之亦然。移除诊断步骤下降 -4.8而将类型化补丁替换为自由形式重写下降 -1.7。结果表明门控和归因是两个承重部件这验证了演化循环设计比迭代更具选择性。表 5演化循环四个步骤的消融跨四个骨干平均。变体轨迹级%↑Δ完整循环89.5-w/o Gate78.3-11.2w/o Attribution83.2-6.3w/o Diagnose84.7-4.8w/o Patch自由形式87.8-1.7表 6DDR-Bench 上演化循环三个可编辑层级的消融跨四个骨干平均。变体轨迹级%↑ΔBaseline69.5-仅内容演化78.28.7仅工具演化82.713.2仅模式演化73.13.6完整三层演化89.520.0演化循环一次限制为单层级并与 DDR-Bench 上的完整三层变体比较跨四个骨干平均。如表 6 所示仅工具演化恢复了最大的单层级增益相对于 Baseline 为 13.2这与清单重塑是归因分析中浮现的主导杠杆一致。仅内容和仅模式演化分别贡献 8.7 和 3.6但都没有达到完整三层循环的 20.0。结果表明三个层级是互补的而非可替代的这验证了在三个可编辑层级上运行的演化循环设计。本体结构的消融研究我们从最终 Evolved 本体中屏蔽每个可移除对象族在 DDR-Bench 上报告四个骨干的平均性能。如表 7 所示屏蔽映射导致最大下降−13.4 轨迹级这与映射作为唯一将术语锚定到具体列和连接路径的对象角色一致。屏蔽证据下降 −8.7因为没有探测查询智能体无法针对底层值分布验证候选 SQL 片段。屏蔽约束和关系产生较小下降−3.5 和 −2.1而术语无法单独屏蔽因为其他每个族都引用它们。这些发现确定映射和证据是两个承重族这验证了我们要求每个提交条目都锚定在探测查询而非仅自然语言描述中的决定。表 7DDR-Bench 上本体内容层五个对象族的消融跨四个骨干平均。术语无法单独屏蔽故省略。变体轨迹级%↑Δ完整 EvoOntology89.5-w/o Mappings76.1-13.4w/o Evidence80.8-8.7w/o Constraints86.0-3.5w/o Relations87.4-2.1跨骨干差异我们研究不同骨干是否收敛到相似本体还是发展出不同本体通过比较它们在 DDR-Bench 上已接受术语标识符集合的成对 Jaccard 重叠。如图 5a 所示没有一对超过 0.62 重叠两个 Claude 骨干之间的共享0.55少于两个 GPT 骨干之间的共享0.61。已接受的编辑在不同骨干之间也不同。例如Claude-Opus-4.8 比 Claude-Sonnet-5 保留更详细的清单变体而 GPT-5.5 在 Evidence 下引入短 SQL 片段库这些在 Claude-Opus-4.8 本体中不出现。然而仅标识符重叠无法确定语义等价因为不同标识符可能编码相似概念。我们进一步通过将每个演化存储应用于所有四个骨干并测量 DDR-Bench 上的轨迹级性能来评估跨骨干迁移。如图 5b 所示对角线一致地是其列的最高条目每个非对角线相对于同骨干存储至少下降 6.6 分从对角线到非对角线的平均列下降范围从 −6.6Sonnet-5到 −10.9GPT-5.5。这些结果表明不同骨干从相同初始化产生不同的演化本体存储。跨骨干迁移结果进一步表明骨干特定演化是有益的。图 5DDR-Bench 上演化本体存储跨骨干的泛化。(a) 四个骨干的演化存储之间已接受术语标识符的成对 Jaccard 重叠。(b) 演化存储的跨骨干迁移每行在一个骨干上拟合并服务于每个骨干列。结论本文提出 EvoOntology一种面向数据智能体的自动构建且自演化的交互式本体层。EvoOntology 将本体封装为 MCP 服务器智能体在运行时主动查询并通过归因引导的类型化编辑精炼它这些编辑仅在经过骨干条件配对评估门控后才被接受。在基准和六个 LLM 骨干上的实验中EvoOntology 始终优于 ReAct 基线和传统语义层基线为帮助数据智能体理解异构数据提供了有效解决方案。
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/10/6 16:05:42
证书链不完整修复方法(进阶篇):原理、方案与优化
2026/10/6 16:05:42
缓存雪崩事故复盘(进阶篇):从入门到实战完整指南
2026/10/6 16:05:42
担忧员工操作速度快,跟不上?合米科技 AI SOP 视觉 200ms 高速推理同步核验工序。
2026/10/6 17:00:47
OPC UA 统一架构实战:从地址空间、信息模型到安全订阅的避坑指南
2026/10/6 17:00:47
WordPress页面编辑入门:区块、模板、404排查与Nginx配置
2026/10/6 17:00:47
Context Mode:让开发工具自动感知上下文,提升效率的实践指南
2026/10/6 17:00:47
Springboot旅游管理系统:从源码部署到毕业设计全流程解析
2026/10/6 17:00:47
矩阵思维与工程实践:从快速幂到特征值分解
2026/10/6 16:55:47
MySQL日期与时间戳转换全攻略:从类型原理到踩坑排查
2026/10/6 1:04:29
搭建无线EEG采集前端:BW16+ESP32-CYD实时波形显示实战
2026/10/6 1:04:29
CH10D功放芯片DIY音箱实战:从选型到调试的完整指南
2026/10/6 1:04:29
视频序列目标跟踪实战:解决ID跳变与遮挡丢失
2026/10/6 15:41:36
Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化
2026/10/6 4:47:52
多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系
2026/10/6 13:15:25
hindsight:面向LLM应用的事后可观测性工程实践
2026/10/5 20:28:25
我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
2026/10/5 20:28:23
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026/10/5 20:28:21
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)