Clipping 视频号

如何写出工业级 AI Agent Skill

by Unknown 原文 ↗
Created: 2026-06-20

作者:未知作者

核心观点:Skill 不是一段更长的 Prompt

如果只是把一大段 Prompt 塞进 Skill,并不等于真正理解了 Skill。工业级 Skill 的核心,不是让 AI 多记几条规则,而是把个人经验固化为一个能够自动触发、稳定执行、持续迭代的工作流。

Prompt 解决的是一次对话中的问题;Skill 解决的是之后一百次类似任务中的重复问题。

视频开头提出工业级 Skill 的主题

视频开头提出工业级 Skill 的主题

第一步:先定义清楚用例

不要一开始就急着写文件。一个真正值得做成 Skill 的需求,至少应该有两到三个具体场景。

需要先回答的问题

  • 用户在什么情况下会触发它?
  • 它需要完成哪几步?
  • 需要调用哪些工具?
  • 最后交付什么结果?

如果连具体用例都说不清,它大概率只是一段一次性 Prompt,而不是 Skill。

第二步:写好描述,让 Agent 能正确匹配

Skill 的正文通常不会一直加载,但描述会长期参与匹配。也就是说,Agent 能不能在正确场景下自动调用 Skill,主要取决于描述是否准确。

好的描述应包含三件事

  • 它做什么;
  • 什么时候使用;
  • 关键能力是什么。

描述不要写成“处理选题”这类空泛表达,而应写得更具体。例如:当用户说“定下周选题”“这周写什么”时,用于规划公众号选题,并输出候选标题和选题角度。

第三步:限制工具边界

工业级 Skill 不是权限越大越好,而是只给它完成任务所需的最小权限。

  • 只读分析类 Skill,不应默认允许修改文件。
  • 只负责生成建议的 Skill,不应允许随意执行命令。

工具边界越清楚,误触发和危险操作的风险就越低。

讲解限制工具边界与权限控制

讲解限制工具边界与权限控制

第四步:使用渐进式披露,不要把所有内容塞进主文件

工业级 Skill 应该采用渐进式披露。主文件只保留最关键的信息,避免把所有规则、细节和资料一次性堆进去。

主文件适合放置的内容

  • 触发条件;
  • 核心流程;
  • 工具要求;
  • 验证方式。

这样既能帮助 Agent 快速判断是否调用 Skill,也能让后续维护和迭代更加清晰。

第五步:根据任务选择模型和思考深度

写文章、做设计、跑数据分析、整理资料,本来就不应该默认使用同一个模型。

  • 复杂任务使用更强的模型;
  • 简单批处理使用成本更低的模型;
  • 关键决策提高思考深度。

成熟的 Skill 系统,本质上是在做任务编排,而不是无脑堆叠最强模型。

第六步:写完后必须测试

一个 Skill 能不能真正投入使用,至少要测试三件事。

  • 能不能跑通;
  • 能不能被正确触发;
  • 结果是否比不用 Skill 更好。

尤其是触发测试,不能只测试“请运行某某 Skill”这种显式指令,而要模拟真实用户平时会怎么表达需求。

  • 该触发却没有触发,说明描述需要优化;
  • 不该触发却触发了,说明边界需要收窄。

第七步:建立评测闭环

最关键的一步,是让 Skill 进入持续评测和迭代的闭环。

讲解 Skill 的评测闭环

讲解 Skill 的评测闭环

评测闭环流程

  • 准备测试用例;
  • 运行一遍;
  • 给结果打分;
  • 找到失败点;
  • 修改 Skill;
  • 再次测试。

常见问题与修改方向

  • 触发失败:修改描述;
  • 流程漏步:修改工作流;
  • 输出不稳定:增加模板;
  • 确定性操作不稳定:编写脚本。

只有完成这个循环,Skill 才能从“看起来能用”,变成真正可靠。

总结:工业级 Skill 的判断标准

工业级 Skill 的核心不在于写得多长,而在于它是否具备以下能力:

  • 能够被正确触发;
  • 能够按流程执行;
  • 权限边界可控;
  • 结果可以验证;
  • 能够不断进化。

如果希望 AI Agent 不只是一个听话的工具,而是逐渐理解自己工作方式的队友,就不能只写 Prompt,而应该把经验沉淀成真正可复用、可迭代的 Skill。

逐字稿

00:00 如果你正在写AI Agent的Skill

00:01 但只是把一大段prompt塞进Skill

00:03 那你可能还没真正理解Skill

00:04 今天分享一套写出工业级Skill的方法

00:06 不管你用的是Codex

00:08 Claude Code

00:08 还是其他支持Skill Agent工作流的平台

00:10 它的核心都不是让AI多记几条规则

00:13 而是把你的经验固化成一个能自动触发

00:15 稳定执行

00:16 持续迭代的工作流

00:17 第一步

00:18 先别急着写文件

00:19 先定义用例

00:20 一个真正值得做成Skill的需求

00:21 至少要有两到三个具体场景

00:23 比如用户什么时候会触发它

00:25 它要做哪几步

00:26 需要调用哪些工具

00:27 最后交付什么结果

00:28 如果你连具体用例都说不清

00:30 那它大概率只是一段一次性prompt

00:31 不是Skill

00:32 第二步

00:32 写好描述

00:33 Skill的正文通常不会一直加载

00:35 但描述会长期参与匹配

00:37 也就是说

00:38 Agent能不能在正确场景自动调用它

00:40 主要看描述写得准不准

00:41 一个好的描述要说清楚三件事

00:43 它做什么

00:44 什么时候用

00:44 关键能力是什么

00:45 不要写处理选题这种空话

00:47 要写

00:47 当用户说定下周选题

00:49 这周写什么时

00:50 规划公众号选题

00:51 并输出候选标题和切角

00:53 第三步

00:53 限制工具边界

00:54 工业级Skill不是权限越大越好

00:56 而是只给它完成任务所需的最小权限

00:58 只读分析类Skill

00:59 就不要默认允许修改文件

01:01 只负责生成建议的Skill

01:02 就别让它随便执行命令

01:04 工具边界越清楚

01:05 误触发和危险操作的风险就越低

01:07 第四步

01:08 别把所有内容塞进主文件

01:09 工业级Skill要用渐进式披露

01:11 主文件只放触发条件

01:12 核心流程

01:13 工具要求

01:14 验证方式

01:21 第五步

01:22 根据任务选择合适的模型和思考深度

01:24 写文章

01:25 做设计

01:25 跑数据分析

01:26 整理资料

01:27 本来就不该默认用同一个模型

01:29 复杂任务用强模型

01:30 简单批处理用便宜模型

01:31 关键决策提高思考深度

01:33 成熟的Skill系统

01:34 本质上是在做任务编排

01:35 不是无脑堆最强模型

01:37 第六步

01:37 写完一定要测试

01:38 一个Skill能不能用

01:39 至少要测三件事

01:40 能不能跑

01:41 能不能正确触发

01:42 结果是不是比不用Skill更好

01:44 尤其是触发测试

01:45 不能只测

01:45 请运行某某Skill

01:46 要模拟真实用户会怎么说

01:48 该触发的不触发

01:49 就补描述

01:50 不该触发却触发

01:51 就收窄边界

01:52 第七步

01:52 也是最关键的一步

01:53 做评测闭环

01:54 准备测试用例

01:55 跑一遍

01:55 给结果打分

01:56 找失败点

01:57 再修改Skill

01:57 触发失败就改描述

01:59 流程漏步就改工作流

02:00 输出不稳定就加模板

02:01 确定性操作不稳

02:02 就写脚本

02:02 这个循环跑完

02:03 Skill才从看起来能用

02:05 变成真的可靠

02:05 所以Prompt解决的是

02:07 这一次对话

02:07 Skill解决的是

02:08 之后100次类似任务

02:10 工业级Skill的核心

02:11 不是写的长

02:11 而是能被正确触发

02:13 按流程执行

02:14 权限可控

02:14 结果可验证

02:15 还能不断进化

02:16 如果你想让AI Agent

02:17 不只是一个听话的工具

02:18 而是越来越懂你工作方式的队友

02:20 那就别只写Prompt

02:21 开始把你的经验

02:22 做成真正的Skill

02:23 这里是V2AGI

02:24 我们下周继续

视频时长 2分25秒 · 消耗 13 积分 · 积分余额 47


内容效果不满意?点此反馈

输入关键词开始搜索