⚔️
比养 Agent 更重要的
是养你的 skill 武器库
六月从 prompt 到 loop 的进化路径
你养的不是 agent,是你的军火库
汀池 · 黄日超
/廿贰
中国色
实战
痛点
所有人都在养 agent,但养错了
一年过去了,你留下了什么?
你花时间在
看起来都在进步
  • 每天写新 prompt 喂 AI(每个任务重新写)
  • 调参数(这次对了,下次又不对)
  • 换更好的模型(GPT-4 → Claude → Gemini)
  • 每次都从 0 开始
算下来一年: 100+ prompt · 3 个模型 · N 次调参
但一年后
啥也没攒下
  • 100+ prompt → 找不到了
  • 调好的参数 → 忘了,下次又调
  • 换模型 → 之前的经验全废
  • 从头来过 100 次
净 留 存 = 零
agent = 一次性工具(用完即弃) · skill = 越攒越多的资产
/廿贰
痛点
对话 一
用户让 Mavis 写 PPT · 改了五次
Mavis Code · 演示项目
skill-arsenal-talk
我周末有个分享,主题是"养 skill 武器库",你帮我出个 8 幕大纲
Mavis好嘞,8 幕:P0 封面 · P1 痛点 · P2 总纲 · P3 范式 · P4 harness · P5 loop · P6 demo · P7 CTA
3 分钟 · 草稿
P3 不对,再想想
Mavis改了,v2
v2 · P3 改写
P5 数据不准,PASS 数量错
MavisPASS 是 12/50,我之前写错了
v3 · 数据修正
P6 节奏卡 1.5min 不够
Mavisv4,调到 2min
v4 · 节奏调整
算了,我让你改了 5 次了,每次都从 0 写 ...
Mavis👀 看到第 5 次 · 这正是 skill / context 化的时机
v5 · 触发 skill 化
输入消息 ...
发送
/廿贰
总纲
五阶进化 + 一旁支 · context → skill
Agent
Prompt
Context
Skill
Harness
Loop
概念一句话何时出现关键事件
Agent跑任务的执行者 · 一次性的起点不在时间主轴上
Prompt临时凑的脚手架 · 第一次写出能用的2023LLM API 开放 · ChatGPT 出圈
Context把 prompt 沉淀成可复用资产2024上下文窗口变长 · system prompt 出现
Skill把 context 进化成可分发武器2025pretty-skills 仓库 · 12 领域
Harness给 agent 装决策栈 + 评委 + 护栏 + 评分2026 初dream 修炼达尔文 v2 · 9 维评分
Loop读场景 → 写手册 → 自动跑 → 人审 → 再用2026 中taste-skill 范式 + human-in-the-loop
2025 旁支
MCP · 把"24 小时跑的能力"封装成可调用的服务 — 与 Skill 同年出现 · 走的是"持续在线"路线 · 不在主链 5 阶里
prompt 是为了解决问题尝试干活 · context → skill 是稳定干活后总结出来的武器
/廿贰
总纲
范式
从脚手架变武器
脚手架 · prompt
  • 第 3 次写同一个 prompt → 该提 context / skill
  • 改 1 个 prompt 改到第 5 版 → 该入 context
  • 解释"不是这个意思"3 遍 → 该沉淀反例
× 5
prompt 写五遍
武器 · skill
× 30
1 个 skill 用三十次
真实案例 · dashiai-ppt · 一周 6 commit,从 v0 到 v3
context 工程 = 把 agent 的失败变成你的资产
/廿贰
范式
定义
skill 是什么 · 一个 SKILL.md 文件
三句话说清
  • 物理形态 · 一个 SKILL.md 文件 + frontmatter
  • 装载方式 · agent 启动时 load 进来 · 像装 1 个"插件"
  • 作用 · 把"提示词"变成"可复用的工作流"
提示词 = 你跟 agent 说的话 · 1 次性 · 容易忘
skill / context = 你写给 agent 看的说明书 · 可复用 · 不会忘
真实 SKILL.md 长这样
--- name: ai-image-to-pptx description: 制作 PPT / 汇报材料时使用 · 5 步 pipeline · 6 商务科技主题 --- # ai-image-to-pptx ## 触发词 · 做 PPT · 讲解图 · 出 .pptx ## 5 步 pipeline 1. 选题 2. 风格 3. 配图 4. 排版 5. 导出 ## 反模式 - 不加风格默认 = 全白 PPT - 不写认知锚点 = 图生完没重点 ...
↑ 这就是 1 个 skill · 60 行 · 装好就能用 30+ 次
/廿贰
定义
对话 二
用户问"能沉淀吗" · Mavis 教 3 步抽 skill
Mavis Code · 演示项目
(接上)能不能别每次从 0 开始?
Mavis这正是 skill / context 化的时机
我帮你抽 3 步:
① 找模板:内容创作/ai-image-to-pptx
② 填字段:8 幕结构 + 4 阶进化图
③ 入库:pretty-skills v0.1
3 步 · context 工程
下次我直接说"用 ai-image-to-pptx 做 XX 主题"就行?
Mavis对,下次 0 改稿直接出
你以后说"用 ai-image-to-pptx 做 XX",我自动套模板
✓ context / skill 入库
那以前我让你改的 5 版大纲呢?
Mavis已经入反模式黑名单
下次自动避开这 5 个错
✓ 反例沉淀
听起来挺简单,但我不记得 ps 命令
Mavis我帮你装好
ps add ai-image-to-pptx + ps list 查一下
✓ 装好
输入消息 ...
发送
/廿贰
拐点
三个判断时机 · 到了就提 skill
3
第三次写同一个 prompt
说明这事不是一次性的 · 该提 context / skill
5
第五版还在改
脚手架已经压不住 · 该入 context
3
解释"不是这个意思"三遍
反例没沉淀 · 该入反模式黑名单
三 / 五 / 三 · 三次机会,没接住 = 这次机会也没了
/廿贰
拐点
概念
harness 是什么
🎯
决策栈
每一步走什么、怎么走、不走会怎样
⚖️
评委
谁打分 · 多个评委 = 不靠 LLM 单点
🛡️
护栏
高风险行动黑名单 · 不可越界
📊
评分
9 维评分 · 自迭代 = 越用越好
harness 不是给你跑的,是给 agent 跑的
/廿贰
概念
数据
九维评分 · dream 修炼达尔文 v2
#维度基线优化目标
1失败模式编码3/108/10
2可执行具体性6/108/10
3高风险行动黑名单2/109/10
44 件套完整度3/107/10
5锦绣素材1/106/10
6跨 agent 兼容性5/107/10
7实战验证3/107/10
8内容数据支撑5/108/10
9维护者活跃度8/109/10
self-improving-agent v2
4.0
v1 基线
7.7
v2 优化后
七天 +3.7 涨分
每条 commit 走一遍 9 维 · 涨分才有意义
/廿贰
数据
对话 三
用户问"失败怎么记" · Mavis 亮 9 维评分
Mavis Code · 演示项目
你修了几次?每次失败都记吗?
Mavis9 维评分 + 多评委 + validation 回滚
dream-log.md 368 行 · 每条 commit 都标了根因
3 件套
9 维是啥?
Mavis[亮 9 维评分表]
1. 失败模式编码 3→8
2. 可执行具体性 6→8
3. 高风险行动黑名单 2→9
4. 4 件套完整度 3→7
5. 锦绣素材 1→6
6. 跨 agent 兼容性 5→7
7. 实战验证 3→7
8. 内容数据支撑 5→8
9. 维护者活跃度 8→9
v1 → v2 · +3.7 涨分
所以你每次失败都会修?
Mavis不会 · 9 维涨分才修
不涨分 = 不入库 = 白修
validation 回滚
听起来好严,不累吗?
Mavis第 1 周累 · 第 4 周同类错 0 次
第 8 周新 case 跑一遍 = PASS
✓ loop 跑通
输入消息 ...
发送
拾壹/廿贰
反例
harness 反面 · 靠 LLM 当裁判的 3 个坑
🐢
LLM 跑 1 轮 = 几秒到几十秒,循环里叠加就是分钟级
🎲
不可控
温度 0 也会漂 · 同输入可能出不同评分
💥
单点失败
token 限流 / API 挂 / 上下文爆 = 整个 loop 停
单一 LLM 评分 = 看似自动 = 实际脆弱
拾贰/廿贰
反例
正例
harness 正面 · dream 修炼达尔文 v2
四件套
  • 9 维评分(量化)
  • 多评委(不靠 LLM 单点)
  • validation 回滚(涨分才入库)
  • 反模式黑名单(防同类错)
自迭代流程
跑 1 次任务
9 维评分
涨分?→ 入库
下次跑 = 涨了
harness = 把"我也觉得"换成"9 维 + 多评委 + 回滚"
拾叁/廿贰
正例
架构
pretty-skills · 三层架构 + 真实证据
内容层用方法论层连接工具层 · 跟其他 skill 库最大的区别
L1
内容层
16 领域 × 62 case · 12 PASS
Agent知识
视觉创作
内容创作
金融投资
编程开发
做事技巧
玄学修炼
+10 领域
每个领域:case / SKILL.md / content.md / 锦绣/
↑↓ 沉淀 / 抽取
核心
L2
方法论层
3F 校验 + dream-log + 自迭代
check-3f.py
9 维评分
多评委
validation 回滚
dream-log.md 每天 23:00 复盘 · 368 行 · 这是其他 skill 库没有的层
↑↓ 调用 / 反馈
L3
工具层
ps CLI + skill-creator · 10 个子命令
ps add
ps create
ps list
ps contribute
ps doctor
ps graph
ps info
ps update
ps rm
+ skill-creator
CLI = 跟方法论层对话的入口
L1 真实
case 文件树 · 视觉创作/PPT证据链战法/
~/knowledge/pretty-skills/视觉创作/PPT证据链战法/ ├── content.md # 7 页 × 7 字段 ├── web.html # 翻页演示 ├── images/ # 7 张 PNG · 1280×720 ├── 锦绣/ # 横屏+竖屏 cover + slides ├── manifest.json # domain=视觉创作 · visibility=public └── PPT证据链战法讲解.pdf # 7 image object · 413KB
L2 真实 · dream-log.md 2026-07-12 真实片段
## 2026-07-12(每日 dream 修炼自动化)
沉淀:新建 视觉创作/PPT证据链战法
content.md (7页×7字段) + web.html + 7 PNG
3F 校验:check-3f.py → EXIT=0 (F1/F3/对齐/真实性/manifest 全过)
INDEX.md:case 计数 12 → 13
## 2026-07-13(每日 dream 修炼自动化)
结论:今日无新增沉淀(无对话/无 commit/无文件改动)
健康快检:14 case 跑 check-3f → 13 PASS / 1 FAIL
FAIL:视觉创作/dashiai-ppt
(portrait 768×1376 vs check 假设冲突,
属 check-3f 设计盲点,非本次范围)
L3 真实 · ps doctor 真实输出
$ ps doctor
16 领域已装 · 62 case 已注册
check-3f.py 在 PATH
dream-log.md 368 行 · 今日 23:00 cron 已就位
1 case FAIL: 视觉创作/dashiai-ppt(设计盲点)
总分 4.0 / 7.7(达尔文 v2 后)
三层架构 = 16 领域有方法论撑 · 方法论有 CLI 跑 · 真实证据看得见
拾肆/廿贰
架构
数据
pretty-skills · 七天 122 commits
16
领域
62
case
122
commits · 七天
12/50
3F PASS · 24%
16 领域目录树 · 真实 ls 输出
~/knowledge/pretty-skills/ ├── 产品设计 ├── 做事技巧 # 11 case ├── 内容创作 # 9 case ├── 商业运营 # 2 case ├── 情感领域 ├── 故事写作 ├── 教育学习 ├── 数据科学 ├── 橙皮书 ├── 游戏玩家 ├── 玄学修炼 # 3 case · 1 PASS ├── 社交主导 ├── 编程开发 # 4 case · 2 PASS ├── 金融投资 # 10 case · 3 PASS ├── 视觉创作 # 15 case · 1 PASS └── Agent知识 # 6 case · 4 PASS
为什么七天做到 122 commits
  • 每天 dream-log 复盘 = 1 天 17+ commit
  • 9 维评分跑 case = PASS 涨分
  • 反例 → 反模式黑名单 → 同类错不再犯
loop 真在跑
dream-log.md 368 行 · 每条 commit 都标了根因
拾伍/廿贰
数据
运转
pretty-skills · 三个状态下怎么工作(真实命令)
对话时匹配 · 干活时执行 · 修炼时迭代
💬
对话时
场景 一 · 匹配 · 16 领域自动定位
我要做一个公众号排版
Mavis
触发 ps list 找匹配
$ ps list --match "公众号排版"
视觉创作/gzh-design (score 0.92)
内容创作/公众号爆款操盘术 (score 0.81)
命中 2/62 · 自动加载 gzh-design 7 主题
↓ 16 领域自动匹配 · 命中 → 加载 SKILL.md
对话 ↔ 库匹配
⚙️
干活时
场景 二 · 执行 · 5 步 pipeline
$ Mavis run skill gzh-design \
--input "公众号排版"
1. 选题 → 5 主题骨架
2. 风格 → 商务科技蓝白灰
3. 配图 → 4 张(封面+插图)
4. 排版 → 锦绣 7 主题
5. 导出 → 公众号文章.md
5/5 PASS · 18.4s
↓ skill 走完 5 步 · 自动 0 返工
输出 · 公众号文章.md
skill → 工具调用
🌙
修炼时
场景 三 · 迭代 · 23:00 自动复盘
$ 23:00 cron → check-3f.py
扫描 14 case 含 *讲解.pdf ...
PASS (13):
Agent知识×4 · 内容创作×2 ·
玄学×1 · 编程×2 · 视觉×1 · 金融×3
FAIL (1): 视觉创作/dashiai-ppt
(portrait vs check 假设冲突 · 设计盲点)
→ dream-log.md 写入今日复盘
↓ 涨分才入库 · 反模式进黑名单
新版 · skill v2 入库
复盘 → 库迭代
三场景闭环 = 对话匹配 → 干活执行 → 修炼迭代 · 真实命令看得见
拾陆/廿贰
运转
对话 四
用户问"loop 怎么跑" · Mavis 讲 5 步节奏
Mavis Code · 演示项目
loop 怎么跑起来?节奏是啥?
Mavis5 步:1. 做任务 · 失败 · 2. 挖根因 · 5 Why · 3. 改 skill · 加反模式 · 4. 入库 · commit · 5. 复盘 · dream-log
loop 5 步
看起来我之前都在 1-2 步就停了
Mavis对,90% 的人停在第 2 步 · 挖到根因 = 不修 · 改 skill = 不会改 · 入库 = 懒得写 · 复盘 = 忘了
卡点分布
那怎么办?
Mavis别一次跑 5 步 · 只跑 1 步 = 跑通 1 次 · 第 2 周加 1 步 · 第 4 周 5 步全跑
✓ 渐进
一周能跑通吗?
Mavis我自己 7 天 122 commits · pretty-skills 就是这么跑出来的
✓ 7 天实证
输入消息 ...
发送
拾柒/廿贰
对话 五
用户问"我今天该做什么" · Mavis 给 3 件事
Mavis Code · 演示项目
听着挺好,但我现在该做啥?
Mavis3 件事:① 写 1 个你自己的 skill · ② 跑 1 个真实任务 · ③ 写下来给别人看
3 件事
我写什么 skill?
Mavis你最常做的那个活 · 比如「公众号排版」「交易复盘」「H5 攻略」 · 从你做过 3 次以上的事情里挑
选 skill 原则
我做过的事情很多,怎么选?
Mavis1 个判断标准:是不是「我不在场也能跑」 · 是 → 提 skill · 否 → 留 prompt
✓ 1 句话选 skill
懂了,我去挑
Mavis👊 去吧 · 挑完告诉我,我帮你走 3 步入库
✓ CTA 触发
输入消息 ...
发送
拾捌/廿贰
收尾 · 关键对撞
harness(事后修正)vs loop(流程里就把控)
loop = 为长任务流而生 · 单任务优化有上限 · 循环 + 喊审 = 把量翻 N 倍 · pretty-skills 是事后修 · harness 修一次 · loop 跑 N 轮
harness 五步 · 事后修正 pretty-skills 真在跑
先做砸 · 再找根因 · 再修 skill · 再入库 · 再复盘
1. 做任务 · 失败
2. 挖根因 · 5 Why
3. 改 skill · 加反模式
4. 入库 · commit
5. 复盘 · dream-log
关键词 · 9 维评分 + 多评委 + validation 回滚
loop 五步 · 为长任务流而生 taste-skill 范式
不是优化单次任务 · 是"循环 + 人工守门"把量翻 N 倍
① 计划
读需求文档
拆 N 份任务
② 执行
自动跑
做一批
③ 守门
🛎 喊人审
等反馈
④ 优化
改 skill
入下一批
⑤ 循环
↻ 跑下一批
直到 N 跑完
📦 100 个 PPT 场景 1️⃣ 计划:读需求文档 → 拆 100 份 → 排优先级 2️⃣ 执行:每 10 个一批 · 自动跑 pipeline 3️⃣ 守门:每批跑完 🛎 喊人审 4️⃣ 优化:反馈回来改 skill · 入库 5️⃣ 循环:跑下一批(11-20 → 21-30 → … → 91-100)· 跑完 100 个 = loop 跑通
关键词 · human-in-the-loop · 每 N 个喊审一次 · 循环让量翻 N 倍
harness 事后修 · 一次 · loop 为长任务流而生 · 跑 N 轮 · 真正成熟的 skill 库两个都要
贰拾/廿贰
对撞
CTA
三个问题
一.你现在的 prompt 有几页?
二.你有自己的 skill 库 吗?
三.你的 loop 跑起来了吗?
先养出第 1 个 skill,剩下的 loop 自己会跑
贰拾壹/廿贰
CTA
技能拆解
ai-image-to-pptx · 5 步 pipeline
skill = AI 出 N 张风格统一图 + 嵌入真实 .pptx · 9 宫图只是 8 幕输出可视化的副产品
PPT 9 宫图
↑ 8 幕真实输出 · 拼成 3×3 = 1 眼看清
(案例:NODESK.AI Cartman 2026 · 马卡龙风)
9 宫图 ≠ skill · 是 8 张图拼起来预览
真正输出 = .pptx · PowerPoint 可二次编辑
5 步 pipeline · skill 本身
1
选题
8 幕内容大纲 · 每页 5 字段(核心主张 / 认知锚点 / 关键要点 / 数据 / 金句)
2
风格
6 主题任选:蓝白灰 / 橙 / 绿 / 红 / 紫蓝 / 黑金 · 或自定义(这次的马卡龙就是)
3
配图 · AI 出图
matrix_generate_image 出 N 张 · 风格统一 · 每张 = 1 幕 · 这是 skill 的核心
4
排版 · 预览
html-ppt-viewer 翻页调试 · 讲前确认排版无问题
5
导出 · 真实 .pptx
python-pptx 把 N 张图嵌进真实 .pptx · PowerPoint / Keynote / WPS 都能开
skill:ai-image-to-pptx · 5 步出 .pptx 9 宫图 = 输出可视化的副产品 · 不是 skill
廿贰/廿贰
演示
← / → 翻页 · F 全屏 · T 切主题 · O 概览
1 / 22
左右滑动翻页 · 触屏操作
📱
请横屏查看
将手机旋转 90°
横屏获得最佳演示体验