Agent-Memory 评测全景:基准、评估与记忆系统(理论篇)
公众号名称:大淘宝技术
作者名称:场景智能技术团队
发布时间:2026-06-03 17:56

本文系统梳理了Agent长期记忆能力的评测全景,涵盖基准数据集、评估框架与记忆系统三大核心维度。在基准方面,介绍了MUSE、LOCOMO等贴近真实交互的数据集;在评估方面,分析了MemoryAgentBench、LONGMEMEVAL及MemBench等框架,重点考察准确检索、长程理解、冲突解决及反思记忆等关键能力;在系统实现上对比了THEANINE、RMM、M3-Agent及Mem0等代表性方案的技术机制与性能表现。文章指出当前技术虽在检索准确性上有所进展,但在跨会话推理、动态更新及效率平衡上仍存瓶颈,并强调未来评测需统一口径,综合考量检索正确性、使用有效性、时间维度及成本约束,以真正指导工程落地。

引言
随着大语言模型(LLM)在对话系统与智能代理中的应用加深,长期记忆能力正成为影响真实效能的关键因素。尽管LLM擅长短上下文生成,但在多轮、跨会话甚至多模态交互中仍常出现遗忘、推理断裂与一致性缺失。如何构建、更新与检索长期记忆,使模型能持续保留关键信息并适应变化,已成为重要挑战。
近年研究从三条主线推进:一是提出更贴近真实交互的基准与数据集(如MUSE、LOCOMO),二是建立更系统的评估框架(如MemoryAgentBench、LONGMEMEVAL、MemBench),三是探索更有效的记忆方法与系统(如THEANINE、RMM、Mem0,以及面向多模态场景的M3-Agent)。这些工作共同揭示了当前技术在检索准确性、跨会话推理、冲突处理与效率上的优势与瓶颈。
本文将从基准数据集、方法框架与记忆系统三方面梳理代表性进展,比较其设计思路、记忆机制与实验结论,并讨论未来应如何在更真实场景、动态更新与结构化表示之间做出更优权衡。

技术概况
▐Memory Benchmark
来源 | 发表(统计截止2026年2月) | |
| MUSE | Northeastern University | ACL 2025,被引次数5 |
| LOCOMO | University of North Carolina | ACL 2024,被引次数274 |
▐Memory Evaluation
来源 | 发表(统计截止2026年2月) | |
| MemoryAgentBench | UC San Diego | arxiv,被引次数43 |
| LONGMEMEVAL | UCLA, Tencent | arxiv,被引次数141 |
| MemBench | Huawei | ACL 2025,被引次数23 |
▐Memory System
来源 | 发表(统计截止2026年2月) | |
| THEANINE&TeaFarm | Yonsei University | NAACL 2025,被引次数23 |
| RMM | ACL 2025,被引次数35 | |
| M3-Agent | ByteDance-Seed | ICLR 2026,被引次数29 |
| Mem0 | mem0ai | ECAI 2026,被引次数222 |

Memory Benchmark
▐MUSE
《MUSE: A Multimodal Conversational Recommendation Dataset with Scenario-Grounded User Profiles》
-
基本信息
| 特点 | 数量 | 场景 |
| 大模型生成对话,基于真实场景和VLM生成的用户画像生成 | 7k个case,8.3w个对话 | 对话推荐数据集 服装领域 |

-
数据集构建
-
用户画像生成器:收集多样的真实场景,生成用户画像,以便更好地匹配用户需求与产品特性。
-
模拟对话生成器:利用用户画像进行角色扮演,模拟用户与推荐助手之间的对话。
-
对话优化器:通过重写和审查机制提升对话的多样性和质量。




-
数据集示例



-
对数据集质量的评估
将 MUSE 与四个数据集(MMCONV、Redial、Inspired 和 P EARL)比较。采用 LLM 评估,随机抽取 200 个对话评估,涵盖对话自然性、逻辑连贯性、信息丰富性、产品上下文相关性和图像文本一致性等五个维度。

基于MUSE数据集,比较不同模型的效果:

▐LOCOMO
《Evaluating Very Long-Term Conversational Memory of LLM Agents》
-
基本信息
| 特点 | 数量 | 场景 |
| 大模型生成对话,基于个性化角色和时间事件图来构建对话 | 50个对话,每个对话平均300轮、9000个标记 | 评估LLM处理长对话的记忆能力:问题回答、事件总结和多模态对话生成 |

-
数据集构建
-
人物设定与时间事件图:获取初始人物设定,利用 LLM扩展设定;每个agent构建的时间事件图包含多个事件,通过因果关系相互连接
-
反思与回应机制:每次会话结束,生成总结,存储为短期记忆;每次对话的单个回合,作为观察内容,存储为长期记忆,在未来的对话中回忆。
-
人工验证与编辑:通过人工矫正,消除长期不一致性、移除不相关图像,并确保对话内容与事件图对齐。人工对15%的对话回合进行了编辑,对19%的图像进行了替换或移除。
多模态对话生成任务中的“观察”,指从对话历史中检索到的与说话者相关的具体信息或事件描述,包含说话者的经历、个性特征、行为模式或与对话内容相关的上下文信息。
人类标注者对生成的对话进行编辑和验证,以确保长期一致性。具体包括以下任务:(1) 编辑对话以消除长期不一致之处;(2) 移除或替换无关的图像;(3) 验证和编辑对话内容与事件图之间的对齐性。标注者大约编辑了15%的对话回合,并且移除了或替换了大约19%的图像。


-
数据集指令






-
对模型能力的评估
-
问答任务能力:具有有限上下文长度的LLM,对极长对话的理解较差。gpt-4-turbo表现最佳(32.4),但仍显著低于人类基准(87.9)。长上下文LLM能理解更长的叙述,但容易产生幻觉。RAG将对话存储为观察内容时有效,随着检索观察数量的增加,性能改善减弱。
-
事件总结任务能力:事件总结任务要求模型理解多次会话中事件的时间和因果关系。gpt-3.5-turbo召回率和F1分数最高。长上下文模型对于上下文的利用不足。五类主要错误,包括信息缺失、幻觉、对话线索误解、说话者归属错误以及不重要对话被错误视为重要事件。
-
多模态对话生成任务结果:包含上下文的训练提升了生成性能,将观察内容作为上下文时,结果更显著。“观察内容”包含说话者的经历信息,导致生成的对话和图像更符合说话者的个性。
-
总体效果:LLMs在理解长时间叙述和提取时间及因果关系方面存在困难。尽管长上下文LLM和RAG提供了缓解,但LLM仍显著落后于人类,尤其是在时间推理和开放领域知识问题上。




评测实验配置:
1. 问答任务(Question Answering)
-
模型类型:评估了三种类型的模型:
-
(1)基础LLM(Base LLMs):使用受限的上下文长度,早期对话被忽略,包括Mistral-7B、LLaMa-70B-chat、gpt-3.5-turbo和gpt-4-turbo。
-
(2)长上下文LLM(Long-context LLMs):扩展的上下文窗口,包括gpt-3.5-turbo-16k。
-
(3)检索增强生成(RAG):从对话历史、观察(关于说话者的断言)或会话级总结中检索相关上下文,使用DRAGON作为检索器,gpt-3.5-turbo-16k作为阅读器。
-
实验细节:对于图像内容,实验中用图像的标题替代原始图像(Li et al., 2023b),并使用最先进的LLM对交织在对话中的纯文本和图像标题进行推理。多模态对话生成任务中直接使用图像。
2. 事件总结任务(Event Summarization)
-
模型类型:使用问答任务中的基础和长上下文设置,但不包括RAG,因为总结任务需要对整个对话有全面理解,而非仅检索特定部分内容。
-
实验细节:实现增量总结,即迭代创建先前会话的总结,并以此作为后续会话总结的基础(Chang et al., 2023)。
3. 多模态对话生成任务(Multi-modal Dialogue Generation)
-
模型训练:使用自动生成的50个对话(没有人工过滤)作为训练数据,训练三种版本的MiniGPT-5:
-
(1)基础模型(Base):仅训练于先前的对话轮次。
-
(2)+总结(+ summary):训练于先前的对话轮次和全局对话总结。
-
(3)+观察(+ observation):训练于先前的对话轮次和从对话历史中检索到的观察。
-
实验细节:每个模型运行均以MMDialog(Feng et al., 2023)微调的MiniGPT-5检查点初始化。

Memory Evaluation
▐MemoryAgentBench
《Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions》
-
基本信息
| 数据集part1 | 数据集part2 | 场景 |
| 重构多个现有数据集 | 并引入新数据集EventQA和FactConsolidation | 评估LLM的记忆能力:准确检索、测试时学习、长程理解和冲突解决 |
LLM-Agent的评估主要集中在推理、规划和执行能力上,而记忆能力的评估则相对不足。记忆能力包括如何记忆、更新和检索长期信息。
本文识别出四个对记忆代理至关重要的核心能力:
1. 准确检索 (Accurate Retrieval, AR):指agent从长对话历史中识别并检索重要信息的能力。
2. 测试时学习 (Test-Time Learning, TTL):指agent动态获取新技能的能力,而无需额外训练。类似于LLM)的上下文学习,通过对话历史中的少量示例学习新任务。
3. 长程理解 (Long-Range Understanding, LRU):指agent在长对话中形成抽象的、高层次理解的能力,能够回答需要整体理解的问题。
4. 冲突解决 (Conflict Resolution, CR):指agent在面对新旧信息冲突时,检测并解决矛盾的能力。agent能够识别并舍弃过时或错误的信息,以反映最新的现实状态。

-
数据集构建
-
本文识别出四个对记忆代理至关重要的核心能力:准确检索(Accurate Retrieval)、测试时学习(Test-Time Learning)、长程理解(Long-Range Understanding)和冲突解决(Conflict Resolution)。
-
MemoryAgentBench结合了重新构建的现有数据集,并引入新数据集EventQA和FactConsolidation,分别用于评估准确检索和冲突解决能力。
-
提供了一个统一的评估框架,允许不同类型的记忆代理在相同的条件下进行比较,从而揭示其在记忆能力上的差异。
-
本文评估了三种主要类型的记忆代理:长上下文代理、检索增强生成(RAG)代理和代理记忆代理,揭示了当前方法在处理动态记忆更新和长程一致性任务时的局限。
Limitation:本文指出,当前使用的合成数据集可能无法完全反映真实用户对话的特征,未来的工作将致力于收集和整理更具现实性的真实数据集。
评估了三种主要类型的记忆代理:
长上下文代理(Long-Context Agents): 现代语言模型通常支持扩展的上下文窗口(从128K到超过1M tokens)。一种直接的策略是维护一个最近token的上下文缓冲区。
检索增强生成(RAG)代理(RAG Agents): RAG代理通过将过去的信存储在外部记忆池中,并在需要时检索相关内容来解决上下文限制。
代理记忆代理(Agentic Memory Agents): 代理记忆代理通过采用代理循环(agentic loops)来超越静态记忆存储,代理可能会重新表述问题、进行记忆查找并更新其工作记忆。定期更新的数据集池。

-
数据集指令


-
评估
-
RAG方法在准确检索任务中表现优越,RAG代理在准确检索类别的任务中优于GPT-4o-mini,RAG代理在提取回答问题所需的小段文本方面表现出色。
-
其次,长上下文模型在测试时学习(TTL)和长范围理解(LRU)任务中表现最佳。RAG方法仅能从过去的上下文中检索部分信息,缺乏对输入的整体理解能力。
-
所有现有方法在冲突解决(CR)任务上均表现不佳,尤其是在多跳场景中,准确率最高仅为6%。只有长上下文代理在单跳场景中取得了相对合理的结果。
▐LONGMEMEVAL
《LONGMEMEVAL: BENCHMARKING CHAT ASSISTANTS ON LONG-TERM INTERACTIVE MEMORY》
-
基本信息
| 特点 | 数量 | 场景 |
| 提出一种统一框架,优化记忆设计:会话分解、事实增强的键扩展和时间感知的查询扩展 | LONGMEMEVAL-S(约115k个tokens)和LONGMEMEVALM(500个会话,约150万tokens) | 评估聊天助手的长期记忆能力:信息提取、多会话推理、时间推理、知识更新和拒绝回答 |
会话分解(Session Decomposition):在长期记忆系统中,用户与助手的会话往往内容繁多且涵盖多个话题。将每个会话作为一个整体存储可能导致检索效率低下,而过度压缩会丢失细节信息,影响系统对复杂问题的回答能力。将会话分解为多个“轮次”,并进一步提取摘要、关键短语或用户事实。
事实增强的键扩展(Fact-Augmented Key Expansion):传统方法使用会话或轮次内容作为键,可能无法有效捕捉到查询与记忆之间的关联。键扩展策略通过提取value中的摘要、关键短语、用户事实和时间戳事件来增强键。
时间感知的查询扩展(Time-Aware Query Expansion):在涉及时间的查询任务中,单纯依赖相似性搜索可能无法满足需求。在索引阶段,从文本中提取时间戳事件;在检索阶段,从查询中推断时间范围,并据此过滤掉不相关的信息。
-
数据集构建
LONGMEMEVAL基准由500个问题组成。每个问题从一个或多个多轮任务导向的用户-助手对话中提取信息。两种配置:LONGMEMEVAL-S(约115k个tokens)和LONGMEMEVALM(500个会话,约150万tokens)。


-
数据集指令



-
评估
-
评估过程中,采用了四个关键阶段的统一框架:索引、检索、读取和评估。在索引阶段,比较不同的值表示策略—会话分解和用户事实提取。在检索阶段,采用时间感知的查询扩展策略,以提高时间推理问题的准确性。在读取阶段,采样Chain-of-Note和结构化提示格式,以提升模型的读取准确性。
-
现有的商业聊天助手和长上下文LLM在LONGMEMEVAL基准上表现不佳,准确率下降30%至60%。当前的记忆机制在处理复杂的长期交互时仍存挑战,需要更复杂的记忆机制,提高个性化和可靠性。
▐MemBench
《MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agents》
-
基本信息
| 特点 | 场景 |
| 包含事实记忆和反思记忆的多场景数据集,并引入参与和观察两种互动场景 | 评估LLM-agent记忆能力,多指标评估(准确率、召回率、容量和效率) |
已有研究对LLM-Agent的记忆能力进行了评估,但这些评估局限性。首先,许多研究主要集中在事实记忆的评估上,而忽视了反思记忆的评估。其次,现有评估大多局限于参与场景,未能充分考虑观察场景的影响。此外,现有研究往往只关注记忆机制的有效性,而未考虑其效率和容量,这在实际应用中同样重要。
事实记忆 (Factual Memory):涉及用户或与其相关实体的事实属性,例如亲属的年龄或职业、事件的时间细节等。这些信息通常在用户与代理的日常对话中。通过提出有关这些属性的问题,测试代理的多种记忆能力,包括信息提取、跨会话推理、知识更新、时间推理等。
反思记忆 (Reflective Memory) :指基于用户表达的低级偏好(例如具体的事实属性,如用户对某道菜的喜爱)和总结出的高级偏好(例如口味偏好等更高层次的信息)。这种机制使得代理能够通过分析用户的低级偏好,推断出用户的高阶偏好或总结出其整体的行为模式或倾向。
参与场景 (Participation Scenario):代理与用户进行互动。代理不仅要记住用户信息,还要记住自己生成的响应。这种场景是代理的典型使用场景。
观察场景 (Observation Scenario):代理仅作为观察者,记录用户输入的信息。代理在此场景中不执行任何动作,因此不会影响记忆。
-
数据集构建
-
数据集包括两种主要的互动场景:参与场景和观察场景。在参与场景中,代理与用户进行互动,而在观察场景中,代理作为观察者被动接收用户输入的信息。数据集的构建过程包括用户关系图的采样和记忆数据的生成,旨在涵盖事实记忆和反思记忆两种不同层次的记忆内容。参与者是常见方式,观察者是创新点。
-
数据集的设计考虑了多层次的记忆:事实记忆和反思记忆。事实记忆涉及用户或相关实体的具体属性,例如年龄或事件的时间细节,而反思记忆则关注从用户的低层次偏好中提取和总结高层次偏好。通过这种方式,能够全面评估代理在信息提取、跨会话推理、知识更新和时间推理等任务中的记忆能力。
-
多指标评估:记忆准确性、记忆召回率、记忆容量和记忆效率。记忆准确性通过比较代理的选择与真实选择来计算,记忆召回率则反映了代理有效存储和组织记忆内容的能力。记忆容量评估代理在达到一定记忆内容量时的表现变化,而记忆效率则关注代理在处理记忆时的时间成本。
-
采用用户关系图采样的方法,结合推荐系统的数据,生成了高层次的偏好属性。并通过自对话方法扩展了参与场景的数据。此外,数据集还包括了多轮对话和用户消息列表,以模拟真实的用户交互过程。这种方法不仅增强了数据集的多样性,还提高了评估的有效性。
Limitation:1)当前的数据集主要集中在结构化数据的评估上,未来可以探索如何评估智能体在用户情感记忆等非结构化数据方面的能力。2)如何在长时间交互中保持反思记忆的能力,也是一个值得深入研究的问题。



-
评估



Memory System
▐THEANINE&TeaFarm
《Towards Lifelong Dialogue Agents via Timeline-based Memory Management》
-
基本信息
| THEANINE框架 | TeaFarm数据集 |
| 构建基于时间和因果关系的记忆图,保留重要的上下文信息;提取和精炼记忆时间线,增强了响应生成的质量。 | 以无人工干预的方式评估代理在整合过去记忆方面的表现 |
-
数据集构建
-
为了评估 THEANINE 的有效性,提出了 TeaFarm,一个基于反事实的评估基准。通过设计反事实问题来测试对话代理的记忆引用能力,确保代理能够在面对不真实的陈述时正确引用过去的对话。
-
在 TeaFarm 中,代理被“误导”生成错误的响应,其任务是通过正确引用过去的对话来避免被误导。例如,通过生成一个非事实的声明(如“Speaker B 不拥有一辆车”),对话代理必须识别并引用真实的对话历史(如“Speaker B 事实上拥有一辆车”)来生成正确的响应。
-
在 TeaFarm 的流程中,对话代理首先会经过一个对话会话的总结,然后通过一个问题生成器(LLM)以时间顺序输入这些总结,生成从两个对话者角度出发的反事实问题及其正确答案。接下来,对话代理会在一个新的对话会话中被询问这些问题,其响应的正确性将被评估。

-
数据集指令


▐RMM
《In Prospect and Retrospect: Reflective Memory Management for Long-term Personalized Dialogue Agents》
-
基本信息
| 主要内容 | 主要操作 |
| 提出了反思记忆管理(RMM)机制,以解决LLM在长期个性化对话中无法有效保留和检索信息的问题 | RMM结合了前瞻性反思和回顾性反思两种方法:前者通过将对话历史总结为主题,优化未来检索;后者则利用在线强化学习动态调整检索机制 |
-
研究背景
LLM在长期交互中保持用户的个性化信息和对话连续性方面存在局限。现有方法面临两个主要挑战:固定的记忆粒度无法有效捕捉对话的自然语义结构,导致信息的碎片化和不完整;固定的检索机制无法适应多样化的对话上下文和用户交互模式。
-
主要操作
反思记忆管理(Reflective Memory Management, RMM)机制:旨在解决大语言模型(LLMs)在长期个性化对话中面临的记忆保持和信息检索的挑战。RMM框架结合了前瞻性反思(Prospective Reflection)和回顾性反思(Retrospective Reflection)两种机制,以实现更灵活和细致的记忆管理。
前瞻性反思:通过将对话历史动态总结为主题基础的记忆表示,优化未来的检索能力。
回顾性反思:利用在线强化学习(RL)方法,基于LLMs生成的引用证据迭代精炼检索过程。
▐M3-Agent
《Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory》
https://github.com/ByteDance-Seed/m3-agent
-
基本信息
| M3-Agent | 算法内容 | M3-Bench |
| 具备长期记忆的多模态智能体框架 | 实时处理视觉和听觉输入 构建和更新记忆 | M3-Bench-robot:100个真实世界视频 M3-Bench-web:929个网络视频 |
-
算法框架
-
M3-Agent:一种具备长期记忆的多模态智能体框架。通过实时处理视觉和听觉输入,构建和更新其长期记忆。
-
记忆生成与存储:情节记忆记录观察到的具体事件,而语义记忆则提取一般知识。记忆以图形结构存储,每个节点代表一个独特的记忆项。通过增量添加新节点或更新现有节点,在长期记忆中保持一致性。
-
控制过程与推理:通过强化学习(reinforcement learning)优化,允许智能体在多轮交互中逐步获取信息,而不是依赖单轮检索增强生成(RAG)。M3-Agent能够自主决定调用哪种搜索功能,以便有效地检索所需的记忆。

-
数据构建
-
为评估M3-Agent的记忆有效性和基于记忆的推理能力,研究团队开发了M3-Bench,这是一个新的长视频问答基准。
-
M3-Bench包括来自机器人视角的100个真实世界视频(M3-Bench-robot)和929个来自网络的视频(M3-Bench-web),并为每个视频注释了问题-答案对,以测试智能体在理解人类、提取一般知识和跨模态推理等关键能力上的表现。




-
实验结果
实验结果表明,经过强化学习训练的M3-Agent在所有基准测试中均优于最强基线,显示出其在记忆生成和推理能力上的卓越表现。具体而言,M3-Agent在M3-Bench-robot、M3-Bench-web和VideoMME-long上的准确率分别提高了6.7%、7.7%和5.3%。

▐Mem0
《Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory》
https://github.com/mem0ai/mem0
-
基本信息
| 特点 | Mem0 | Mem0g |
| 提出Mem0和Mem0g两种记忆架构,提升LLM在长时间对话中的一致性和连贯性 | 通过动态提取、整合和检索对话中的关键信息,提高了单跳和多跳推理的性能 | 引入图形记忆表示,增强了对复杂关系的建模能力 |

-
算法框架
Mem0记忆架构:
-
对持续对话的显著信息进行动态捕获、组织和检索。
-
在提取阶段,系统接收一对消息(用户消息和助手响应),利用数据库的对话摘要和最近消息来建立上下文。将这些信息与新消息对结合,生成一个综合提示,用LLM提取重点记忆。
-
在更新阶段,评估提取的候选事实与现有记忆的一致性,通过LLM进行适当的记忆管理操作(如添加、更新、删除或无操作),以确保知识库的一致性和时间一致性。

Mem0g:
-
在Mem0的基础上引入了图形记忆表示,旨在更好地建模对话元素之间的复杂关系。将记忆表示为有向标记图,节点代表实体,边表示实体之间的关系。
-
实体提取模块,识别对话中的关键实体及其类型;关系生成模块,通过分析上下文生成实体之间的关系三元组。结构化的图形表示使Mem0g能在处理复杂查询时进行更高级的推理。

-
数据构建
使用LOCOMO数据集评估长时间对话记忆的能力:
-
该数据集包含10个扩展对话,每个对话有600个对话轮次和26000个标记,涵盖多个会话。
-
每个对话后附有200个问题,分为单跳、多跳、时间和开放域四类。
-
评估指标包括传统的F1分数和BLEU分数,以及基于LLM的评估方法、提供更全面评估。





-
实验结果
-
比较了六类基线系统,包括LOCOMO基准、开源记忆解决方案、RAG方法、全上下文处理、专有模型和记忆管理平台。
-
Mem0和Mem0g在多种问题类型上表现优越,Mem0在单跳和多跳推理任务中表现出色,Mem0g在时间推理和开放域任务中表现出色、结构化图形表示在捕捉事件序列和时间关系方面存在优势。
-
Mem0和Mem0g在响应延迟和计算效率方面表现出色,尤其是在与全上下文方法的比较中,显著降低了延迟和令牌消耗。

Single-Hop(单跳):从单个对话轮次中检索单个事实性信息。例如,如果用户询问“某人昨天去了哪里”,且相关信息在对话中直接提到,则系统只需从单个对话中提取答案。
Multi-Hop(多跳):从多个对话轮次中合成信息。例如,将对话中的两个独立声明结合(如“某人昨天去了某地”和“某地的天气如何”)来推导答案,则需要多跳推理。
Open Domain(开放域):结合对话中的信息与外部知识。例如,如果用户的问题涉及对话中没有直接提到的内容,需要结合对话中的信息和外部知识库进行回答。
Temporal(时间推理):正确建模对话中事件的时间顺序、持续时间及其相对时间关系。例如,涉及“某人何时去了某地”,则要利用对话中的时间戳或隐含的时间信息进行推理。

p50(median):表示50%的延迟值低于或等于此值,50%的延迟值高于或等于此值。
p95(95th percentile):表示95%的延迟值低于或等于此值,只有5%的延迟值高于此值。

总结与讨论
当 Agent 从单轮对话走向长程任务与跨会话交互,Memory 从“加分项”变成决定体验与能力上限的关键组件:它影响多轮一致性、知识与偏好的持续利用,以及跨任务的经验复用。因此,Agent-Memory 评测不应止于“跑分排名”,而应回答三件事:记什么、怎么记、是否带来可量化的任务收益。
本文沿三条主线梳理:Memory Benchmark(评什么:任务/数据/指标口径)、Memory Evaluation(怎么评:评测协议、对照与消融、误差归因)、Memory System(怎么落地:存储与索引、写入与更新、冲突与时效、隐私权限、与 Agent/RAG/工具链集成),并对代表性方案的取舍进行对比。现有评测仍有共性问题:1)增益难归因(记忆、长上下文、RAG 常叠加);2)口径不统一,易“命中但无用”,指标与端到端收益脱钩;3)动态更新与遗忘覆盖不足,缺少长期压力测试;4)成本与约束缺位(时延、token/调用、存储、隐私合规)。
面向真实应用,更可用的评测应同时覆盖四个维度:检索正确性、使用有效性、时间维度(跨会话/变化/遗忘)、成本维度(延迟/费用/存储/合规)。只有纳入统一且可复现的框架,评测才能真正指导选型与工程迭代。
我们也在持续探索面向真实业务的 Agent 记忆体系与评测闭环;如你在落地中遇到更新、冲突处理或评测设计问题,欢迎交流。

团队介绍
本文作者阿元,来自淘天集团 - 场景智能技术团队。一支专注于通过 AI 和 3D 技术驱动商业创新的技术团队,依托大淘宝丰富的业务形态和海量的用户、数据,致力于为消费者提供创新的场景化导购体验,为商家提供高效的场景化内容创作工具,为淘宝打造围绕家的场景的第一消费入口。我们不断探索并实践新的技术,通过持续的技术创新和突破,创新用户导购体验,提升商家内容生产力,让用户享受更好的消费体验,让商家更高效、低成本地经营。
¤ 拓展阅读 ¤
内容效果不满意?点此反馈