写了100条Skill,25条在帮倒忙——复旦微软150组实验的实操结论
公众号名称:AI知识体系礼记
作者名称:乌空
发布时间:2026-05-30 19:08
复旦、微软、上交大联合发了一篇关于Agent Skill的系统性评测。文章标题不算起眼,但摘要里一个数字直接把我钉住了。
25%
负迁移率 — 每4条技能就有1条在帮倒忙
不是提升,是负迁移率。150组实验里,四分之一加了skill反而变差。
这个比例让我心里咯噔一下。作为一个靠给Agent写skill混饭吃的人,我忽然很想知道自己写过的东西里,有多少是在给Agent帮倒忙。
01
技能蒸馏这个事,先交代一下背景
简单说,技能蒸馏就是让Agent在任务里跑一遍跑出轨迹,然后另一个模型把这些轨迹提炼成一份操作手册。以后执行类似任务的时候,把这份手册塞进上下文里,让Agent照着来。
听起来像人类学习:做一遍→总结教训→下次做得更好。逻辑顺畅得让人很难质疑。
但这项研究干了件特别实在的事。他们没去论证技能蒸馏有没有用——这已经被反复说过很多次了。他们问的是另一个问题:有用的时候为什么有用?没用的时候卡在哪里?
为此他们搭了150组实验:5个领域×6个消费者模型×5个提炼者模型,每组跑3次取平均。
这个实验规模,在我读过的Agent评测论文里是最大的。而结果,比我想象中有意思得多。
02
GPT-5.4是最强的选手,却是最差的教练
实验里有个反直觉的发现让我反复看了好几遍。
以电子表格任务为例,五个提炼者的技能效果排名是这样的:
Gemini-3.1-Flash-Lite排第一。Qwen3.5-35B排第二。然后Gemini-3.1-Pro、GPT-5.4-mini。GPT-5.4垫底。

能力最强的模型,提炼技能的能力反而最差。
研究团队的分析让我觉得有意思——GPT-5.4的提炼风格是”全面罗列型”,试图覆盖所有边界情况,一次能写出十几条详细规则。而Gemini Flash Lite是”简洁聚焦型”,只留最核心的三五条。
信息过载,反而比信息不足更致命。
我自己做项目的时候其实碰到过类似的。给Agent写的prompt越长,它越容易跑偏。几百字的约束条件塞进去,它经常把最关键的那两条忽略了,反而在边缘条款上反复纠结。
当时我以为是我写的不够好。现在看,这是个系统性问题——作为AI Native Coder,我一直在高估大模型”精准理解多约束”的能力。
03
同样一份技能,不同模型吸收差距大到离谱
另外一个让我觉得值得说一说的点,是消费者端的差异。
实验里有一份”强池技能”——用GPT-5.4的成功轨迹提炼出来的,算是顶配原材料了。给不同模型用:
Qwen3.5-35B提升了9.5个百分点。GPT-5.4自己提升了8.2。但Gemini-3.1-Pro只提升了1.8。Qwen3.5-9B甚至微降了0.3。
同样一份技能,不同的模型从中吸收的东西完全不一样。小模型不是不努力,是能力不够——它根本理解不了那份技能在说什么细节。
这就引出一个很实际的问题:你在大模型上优化好的技能,迁移到小模型上可能不仅没用,还会起反作用。技能不是模型无关的。
04
ALFWorld的47%,才是最让人担心的情况
按任务领域看,负迁移率分布极不均衡。
代码修复任务和电子表格任务,负迁移只有13%。但ALFWorld——一个模拟家庭环境的物理任务(找苹果、洗杯子、加热食物)——负迁移率直接飚到47%。

将近一半的技能,用了不如不用。
为什么会差这么多?论文给的解释是:代码和表格任务的状态是离散的、可验证的、有明确对错。但物理环境中的”好”和”坏”是连续的、模糊的。技能指导在这种环境下不仅帮不了忙,反而限缩了Agent的探索空间。
这让我联想到一个事。很多人在推广Agent Skill的时候,默认的场景都是代码类任务——写脚本、改bug、处理数据。因为在这些场景里技能确实好用。但一旦推到状态复杂、需要灵活应对的环境,技能的边际效用就断崖式下滑了。
不是技能没用。是技能只在一类特定的场景里有确定性收益。
05
AI给自己列的7条质量标准,6条帮倒忙
这是我觉得这篇论文最幽默,也最有启发性的一段。
研究团队让AI自己列一份”好技能应该具备什么特征”。AI认认真真列了7条:清晰度、完整性、简洁性、逻辑结构、格式质量、语气中立性、普遍适用性。
听起来都对,对不对?
然后他们把这7条放进系统提示词,让提炼者照着来。结果:9个评估格里6个出现性能下降。不仅没用,反而是反向引导。

反过来,研究团队通过实验筛选出的3个真正有效的维度是:
可操作的具体性——不是”要小心处理数据”,而是”使用.iloc进行基于位置的索引,避免列名匹配错误”。
失败机制编码——不是”这步可能出错”,而是”当A列有空值时,直接计算会触发TypeError,需要先用fillna(0)预处理”。
高风险操作黑名单——不是”谨慎操作”,而是”绝对不要使用dropna()删除整行,这会破坏数据对齐”。
这三条,一条比一条具体,一条比一条不可逃避。而AI自己列的7条,全部是”看着对但执行不了”的原则性废话。
我读到这里的时候停顿了好一阵。因为不只是skill生成,在几乎所有跟AI协作的场景里,我们都下意识地在追求”说得漂亮”而不是”说得有效”。AI自己也在这么做。
06
元技能:那个零成本的提升手段
最有实操价值的部分在最后——研究团队把这3条标准写成了一段很短的”元技能”,只需要在提炼者开始生成skill之前加到它的提示词里。
效果是:9个评估格全部提升,平均加了1.55个百分点。在电子表格任务上尤其明显,再提了2.3到3.7个百分点。
什么代码都不用改,什么流程都不用动。就是加了几行字。
在提炼技能时,第一,提供可操作的具体步骤,明确引用领域内的对象和工具;第二,清晰说明失败的具体机制,而不只是泛泛地说会出错;第三,列出高风险操作黑名单,明确禁止那些已被证明有害的操作模式。
就这么三段话。成本为零,效果可测。
07
几点我觉得能直接用起来的
写完这篇,我觉得有四个点值得任何在维护Agent Skill库的人认真想一想。
第一,不要默认技能一定有用。加技能前先做A/B测试。这不是形式主义——25%的概率你加的东西在拖后腿。
第二,不要再让最强的模型当提炼者了。用中等甚至偏小的模型提炼技能,效果可能更好,成本只有十分之一。这件事彻底推翻了我的直觉。
第三,技能得分场景。规则明确、结果可验证的任务(代码、表格、数据处理),技能是助攻。状态复杂、需要灵活探索的任务,技能可能是枷锁。
第四,把你所有的skill生成流程加一段元技能提示。三句话的事,不用改任何代码,但每条新生成的skill的质量都会有可测量的提升。
复旦和微软这篇论文,说到底不是在否定技能蒸馏。它是在说:技能蒸馏有用,但前提是你搞清楚它什么时候有用、怎么让它有用。
这大概就是AI工程从”试试看”走向”可控”的必经之路——不是靠感觉,是靠实验。
· 论文:From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills
· arXiv: 2605.23899 | 复旦大学 · 微软研究院 · 上海交通大学 | 2026年5月

原创 乌空 AI知识体系礼记
内容效果不满意?点此反馈