Clipping 微信公众号

字节二面被问:-工作记忆在 Agent 执行任务时,究竟承担什么角色?-,我说:-临时储存信息的地方-,他说:-这么说没错,但是不全面...-

by 算法狗 原文 ↗
Created: 2026-06-29

公众号名称:算法狗

作者名称:算法狗

发布时间:2026-06-29 17:40

前段时间有个粉丝去面字节的Agent方向岗位,二面的时候面试官问了他一个问题:“你觉得工作记忆在Agent执行任务的时候,究竟承担什么角色?”

他想了想,给了一个大多数人都会说的答案:“就是临时储存信息的地方嘛。”

面试官听完笑了笑,点点头说:“这么说没错,但是不全面。”

他有点懵,不知道该怎么往下接。面试官又换了个角度问他:“那你说说,如果Agent同时收到一段文字投诉、一张破损商品图片、还有一段语音留言,工作记忆在这个过程里具体做了什么?”

他挠了挠头,说:“就是……先把它们存起来?”

面试官没有直接否定,只是问了一句:“那存起来之后呢?Agent怎么决定先看哪个、忽略哪个?怎么把三路信息整合成一个判断?”

他愣了一下,意识到自己从来没认真想过这个问题。他以为工作记忆就是个临时缓存,没想到它还有筛选、推理、规划这些主动作用。

这个问题其实很多人都没答好,今天展开讲。

✦ ✦ ✦

1. 感知输入的暂存与筛选

字节面试官问的这个问题,其实挺有代表性的。大多数人第一反应就是”临时储存信息的地方”,这个答案不能说错,但确实没有说到点子上。

问题出在哪呢。就是这种表述把工作记忆给降格了,降格成一个被动的容器了。就好比你给水管装了个蓄水池似的。但真正让面试官感兴趣的是什么呢,是你能不能从认知科学的角度,把它的四重主动作用给说清楚。哪四重呢,就是筛选、推理、规划、装配。这四件事啊,每一件都不是被动发生的。

先来说第一层吧。就是感知输入的暂存与筛选。

你不妨想象一下字节面试官问的那个场景。就是用户同时给你发来了一段情绪很激烈的文字投诉,还有一张破损商品的图片,另外还有一段语音留言。这三股信息同时涌进来了,Agent 面临的第一个问题是什么呢。不是”怎么回复”,而是”该看什么、该忽略什么”。

这恰恰就是工作记忆介入的时机。

它就像一道选择性的滤网一样。文本里面的语气助词呢,就被过滤掉了。图片里面破损的具体位置呢,就被放大标注出来了。语音里面的那些关键诉求呢,就被单独提取出来了。

这里有个细节值得我们注意一下。就是工作记忆和短期记忆这两个概念,在日常语境里面经常被混着用。但是认知心理学家 Alan Baddeley 在 1974 年提出工作记忆理论的时候,特意把它们做了区分。短期记忆呢,只是”短暂保存信息”。而工作记忆呢,是”在保存的同时还进行加工”。这个”加工”两个字啊,才是关键所在。

换句话说呢,要是没有这一层过滤机制的话,Agent 在处理图像的时候,它最初接收到的那些文字信息可能就已经悄悄消散掉了。这样的话它就没办法把三路信息整合成一个完整的判断。

✦ ✦ ✦

2. 推理的演算草稿纸

面试官追问的”存起来之后呢”,其实就是在问这第二层。

当 Agent 在判断这笔订单是不是满足退款条件的时候,它需要同时去对照好多条规则。先从长期记忆里面把售后政策给调出来,然后再拿来和当前的订单信息进行比对。这个”同时摆在台面上看”的动作呢,就是工作记忆在做的事情。

认知科学里面有个很经典的概念。就是 George Miller 在 1956 年提出来的那个”7±2 法则”。这个法则是说人类工作记忆一次大概能处理 5 到 9 个信息单元。后来的研究修正得更保守一些,认为真实有效的容量大概只有 4 个”组块”,英文叫 chunk。

Agent 的上下文窗口本质上是同一个道理,只不过粒度换成了 token。

在推理这个阶段呢,“用户信誉良好”和”商品破损属实”这两条中间结论,会被暂时挂在工作记忆里面,等着被纳入最终判断。它们不是最终答案,而是下一步推论的跳板。

值得一提的是啊,这和人类思考的时候草稿纸的作用是非常相似的。你在解数学题的时候,中间步骤写在纸上,不是为了给别人看的,而是为了留住你下一步还需要用到的东西。Agent 的工作记忆呢,本质上就是这么一张数字草稿纸。

✦ ✦ ✦

3. 规划的推演沙盘

第三层比第二层更有意思。它不只是”现在是什么状态”,而是”如果我这样做会怎么样”。

Agent 生成了两个候选方案。一个是直接退款加道歉,另一个是只补一张优惠券。接下来呢,它要在工作记忆里面分别去推演这两个路径的后果,这样才能选出那个代价最小、收益最大的选项。

这个”零成本试错”的过程呢,就是规划能力的核心。

退款方案的直接成本是 50 块钱,但是能挽留住一个高价值的用户,综合风险权重比较低。优惠券方案呢,钱是省了,但可能会让用户投诉升级,长期损失反而更大。这两套账啊,都是在工作记忆里面算出来的,不是调用外部工具去算的,也不是等到真正执行完了才知道结果。

有趣的是什么呢,就是这跟棋手在落子之前的思考方式几乎是同构的。不是随机去试错,而是在脑子里面同时维持多个假设状态,然后逐一去评估代价再做决定。Agent 在工作记忆里面做的呢,正是这种受控的假设推演。

✦ ✦ ✦

4. 行动与验证的装配车间

方案选定之后呢,最后一层就是把结论变成可以发送出去的内容。

这封回信需要同时包含三个部分。一个是有温度的道歉语句,一个是退款订单的链接,还有一个是赔偿说明。这三个组件各自有语气、有格式要求,还得互相配合,读起来要像一个人说的话,而不是三段话拼凑在一起。

工作记忆在这里充当的呢,就是装配线上的组装台。

但是这个台子它是有面积上限的。如果输入的信息太多了,早先暂存的那些内容就会被新内容给挤出去。道歉语句还没写完呢,链接就覆盖进来了。最终发出去的呢,可能就是一封语义断裂的、让用户更加愤怒的回复。

这正是工作记忆最核心的工程约束。它既是引擎,也是瓶颈。

✦ ✦ ✦

关于”瓶颈”这件事呢,值得多说两句。

ChatGPT 刚推出来的时候,上下文窗口只有 4000 个 token。到了 2025 年呢,主流模型已经普遍支持 128K token 了,部分前沿模型甚至突破了百万 token。但是窗口变大了,并不意味着问题就消失了。研究发现啊,随着上下文变长,模型在中间位置的信息上面准确率会明显下降,这个现象被称为”上下文衰减”。

换句话说呢,工作记忆越大,不一定就越好用。管理它的策略呢,才是真正的技术难点。

目前工程上的主流解法是什么呢,就是引入注意力筛选机制来压缩高价值的信息,然后再配合 RAG,也就是检索增强生成,把重要的结论写入外部的长期记忆里面。需要的时候再检索回来。这就是工作记忆和长期记忆之间那条双向通道存在的意义。不是简单地”存”和”取”,而是在每次任务中动态地去决定什么值得被记住、什么可以被丢弃。

✦ ✦ ✦

回到面试现场吧。

如果你只是说”工作记忆就是个临时记事本”的话呢,这道题就已经答完了,而且是答错了。

真正的回答应该是怎样的呢,应该是把它的四层作用展开来讲。就是感知过滤、推理草稿、规划沙盘、装配验证。并且还要能指出它的核心矛盾,就是它既是 Agent 思维的舞台,也是制约 Agent 能力上限的瓶颈。

在我看来呢,理解工作记忆最关键的一点,不是它能装多少,而是它在装满之前,能做多少有意义的事情。这个维度呢,才是区分一个”会用 Agent”的工程师和一个”理解 Agent”的架构师之间,真正的分水岭。

你遇到过这个问题吗?评论区聊聊,看看大家是怎么理解工作记忆的。


内容效果不满意?点此反馈

输入关键词开始搜索