首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
ReMe LongMemEval 89.4%成绩拆解:Agent跨会话记忆评测是怎么做的
📅 2026/9/17 23:54:46
✍️ 爱科研究院
👁 阅读 3,247
ReMe LongMemEval 89.4%成绩拆解:Agent跨会话记忆评测是怎么做的【免费下载链接】ReMeReMe: Memory Management Kit for Agents - Remember Me, Refine Me.项目地址: https://gitcode.com/GitHub_Trending/me/ReMeReMe 是一款面向 AI Agent 的记忆管理工具包Remember Me, Refine Me最近它在 LongMemEval 这个专门考察 Agent 跨会话长期记忆能力的评测基准上取得了 89.4% 的总准确率。这篇文章带你完整拆解这套 Agent 记忆评测是怎么做的数据从哪来、500 道题如何分型打分、记忆如何写入与检索、LLM 裁判如何判卷以及你自己如何在 10 分钟内复现这个成绩。LongMemEval 是什么专考跨会话记忆的基准LongMemEval 与常见的单轮问答评测不同它的每个条目item都由两部分组成 一段按时间排序的历史会话用户和助手之间多轮、多会话的聊天记录一个探测问题答案只能靠推理用户私有记忆才能得到比如我上周说过的咖啡品牌是什么我搬家前住的是哪个城市。这正好戳中了 Agent 记忆系统的软肋答案不在当前对话里必须从几十上百个历史会话中检索、拼接、更新。ReMe 使用的数据集是cleaned-S版本共500 题ground truth 已内嵌在数据文件中见 benchmark/longmemeval/README_ZH.md。题型覆盖 6 大类ReMe 的分型成绩如下题型含义准确率knowledge-update知识更新新信息覆盖旧信息91.0%multi-session多会话推理答案散布多个会话84.2%single-session-assistant单会话·助手侧信息100.0%single-session-user单会话·用户侧信息98.6%temporal-reasoning时间推理隔了几天类问题90.2%single-session-preference用户偏好类个性化回答63.3%总分OVERALL500 题平均89.4%评测全流程拆解从摄入到判卷的 5 个阶段整个评测管线由 run.py 驱动评测参数集中在 config.yaml。每个条目都会被关进一个隔离工作区item_0、item_1……互不串味。第一步按时间顺序摄入会话会话先按时间戳排序然后过滤掉晚于提问时间question_date的会话——这是评测公平性的关键Agent 不允许看到未来。这段逻辑在 run.py#L287-L298。随后每个会话通过auto_memoryJob 写入 ReMe 工作区由 LME 插件定制的 LmeAutoMemoryStep 会把对话中的事实沉淀成按日期组织的记忆文件daily note并对缺失的时间戳做线性插值保证时间线连贯。每摄入一个会话就手动触发一次index_update让 BM25 关键词索引和向量索引同步就绪公共 Job 定义见 reme/config/benchmark.yaml。第二步以 ReAct Agent 模式答题答题不是把问题丢给模型而是交给一个agenticReActAgent它能自主决定何时调用search工具去工作区里翻记忆找到线索后再作答。Agent 使用独立的benchLLM 组件支持思维链、40 万上下文窗口最多迭代 30 轮benchmark.yaml#L434-L445。search工具背后是混合检索向量检索 BM25 关键词检索并行执行再用 RRF倒数排名融合合并排序search_v2.py#L56-L88。这种双路召回设计让精确词命中和语义相似都能覆盖到。第三步LLM-as-Judge 二元判卷答案对错由独立的裁判插件打分而不是字符串匹配。LmeAnswerJudgeStep 会按题型选择不同裁判提示词时间推理题容忍差一天的 off-by-one 误差知识更新题只要给出更新后的答案即算对偏好题不要求覆盖全部要点正确召回并使用用户个人信息即可。裁判只输出一个词yes或no规则简单、结果可复现提示词全文见 llm_judge.yaml。第四步并行执行与结果输出500 个条目通过多进程并行处理num_workers: 32最终在 10 分钟内跑完 eval-only 阶段结果以 JSON 写入benchmark/longmemeval/results/并打印分题型准确率与 token 成本统计。记忆长什么样Agent 记忆即文件ReMe 的记忆没有黑盒数据库——全部落在工作区里的普通 Markdown 文件上你可以直接打开看 Agent记住了什么。在 ReMe Studio 的图形界面里记忆文件还能以图谱形式呈现直观看到记忆之间的关联这种记忆即文件的架构docs/zh/memory_as_file.md让评测变得透明每个条目一个工作区跑完后你可以逐文件核对记忆写入、索引构建的每个环节这也是 ReMe 能在 multi-session84.2%和 temporal-reasoning90.2%这类难题上拿到高分的工程基础。如何 10 分钟复现 89.4%克隆仓库后按下面 4 步即可复现完整说明见 benchmark/longmemeval/README_ZH.md安装python -m pip install -e .[as]再 editable 安装两个插件lme答题方和lme-judge裁判方下载数据集python benchmark/longmemeval/download.py配置模型凭据模型参数走环境变量在公共 benchmark 配置中声明运行python benchmark/longmemeval/run.py加--eval_only可复用已有工作区、只跑查询判卷。怎么看待 89.4% 这个分数最后给新手 3 个读分视角 看短板preference 类只有 63.3%说明把用户偏好记住并自然地用出来仍是 Agent 记忆系统公认难点看成本平均每题仅 3.69 次工具调用、约 4.4 万 token说明混合检索Agent 检索的性价比路线是可行的看方法隔离工作区 时间过滤 分题型裁判这套评测框架本身就值得借鉴到任何记忆系统测试中。Agent 跨会话记忆评测没有捷径但 ReMe 的这套流水线摄入 → 索引 → ReAct 检索答题 → 分型裁判已经把怎么测、怎么算分讲得非常清楚。想深入源码可以从 plugins/lme 插件目录入手每个 Step 都对应评测管线中的一个阶段。【免费下载链接】ReMeReMe: Memory Management Kit for Agents - Remember Me, Refine Me.项目地址: https://gitcode.com/GitHub_Trending/me/ReMe创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/17 23:54:46
TPM版本演进史:从v0.0.1到v3.1.0,tmux插件管理器如何一步步走向完善
2026/9/17 23:54:46
C#结构体内存优化实战与性能提升
2026/9/17 23:54:46
毕设选题避坑指南:为什么“好抄”的题目最容易翻车
2026/9/18 0:44:50
Agent技能系统设计与实践:让智能体具备可复用的专业能力
2026/9/18 0:44:50
STM32智能鱼缸:本地闭环控制与微信小程序物联网设计
2026/9/18 0:44:50
PMBOK第六版与第七版学习全攻略:知识总结与备考路径
2026/9/18 0:44:50
Aptos 公网全节点 Helm 部署指南:基于 aptos-core 的 aptos-fullnode 图表配置与运维全解析
2026/9/18 0:44:50
工控协议太多怎么啃?个人开发者的高效采集实战指南
2026/9/18 0:39:50
云端部署Grok Bot:基于Python与插件体系的X平台自动化助手搭建实战
2026/9/18 0:04:47
AReaL 调试指南:从 Agent Workflow 验证到分布式训练死锁诊断
2026/9/18 0:04:47
MATLAB实现GPS L1 C/A信号仿真与二维捕获验证
2026/9/18 0:04:47
彻底搞懂ASCII、Unicode与UTF-8:从乱码根源到编码实战
2026/9/16 18:36:59
拯救者Y7000黑屏故障排查与维修实战指南
2026/9/16 7:38:03
AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
2026/9/17 4:19:54
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化