我做了一个 AI 私教 Skill:从"想认真学 Redis"到 Skill Lift +275% 的完整复盘
我的收藏夹里躺着 137 篇"Redis 从入门到精通"。
它们的共同归宿是:收藏那天翻开第 1 节,然后在某个周二之后再也没有打开过。
ChatGPT 出来之后我又试了一种新学法:对它说"教我学 Redis"。它很热情——30 秒甩给我一份五区块大纲,然后不等我点头就开始讲缓存穿透。讲得不错,真的。但我听了三天就弃了,因为我不知道自己在哪、不知道学完没有、换个窗口又得从头再来。
那一刻我意识到:我不缺知识来源,我缺一个"教练"。 于是就有了这个项目。
这是「AI Agent 工程实践」专栏的引流复盘篇。前几篇一直在"拆解"它——评估方法学、硬约束协议、双文档续接、动态模块池——这篇用第一人称讲讲它从无到有的完整过程:为什么做、踩了什么坑、数字是怎么来的、以及你怎么 10 秒拥有它。
📌 TL;DR 速览
- 讲什么:一个 AI 私教 Skill 的三幕剧——全量测试全绿 → 真人试玩翻车 → 修复后再翻车
- 核心结论:自动化测试全绿 ≠ 产品能用;唯一解药是"试玩 → 改协议(不打补丁)→ 定向回归"闭环
- 三个关键数字:3 轮回归 | 2 处协议自洽缺陷当场修复 | Skill Lift +275%
- 适合谁:独立开发者,或正把第一个"AI 产品"当宝贝的人
一、缘起:三种学法的三种死法
做这个项目之前,我认真分析过"为什么学了就废":
| 学法 | 死法 |
|---|---|
| 收藏教程/专栏 | 没有进度感——永远"从入门开始",不知道自己在哪,放弃成本极低 |
| 问 AI"教我学 XX" | 没有流程——不摸底就开讲,不确认就加速,讲完不管你会不会;窗口一关,全剧终 |
| 培训班 | 不便宜——且内容固定,不管你什么基础、什么目标 |
三种死法的共同根因:知识是现成的,但"教学流程"是缺失的。 诊断、定路线、确认后开课、验收、复盘、续接——这些才是教练值钱的地方,而这恰恰是可以被协议化的。
于是目标定了:做一个 Agent Skill,让任何 LLM Agent 变成一位大厂架构师私教——你说"我想学 Redis",它先摸底、再和你协商路线、你点头才开课、每节课有量化验收、窗口关了能从文件无损续接。
二、核心信念:LLM 不缺知识,缺的是流程
动手写第一行"代码"(其实是第一行 Markdown)之前,我先做了一个思想实验,它决定了整个项目的架构:
同一个顶级模型,裸奔和带上 Skill,在教学场景下差多少?
后来这个思想实验成了正式的评估(with_skill vs without_skill 的 A/B 对照)。实测结果比我想的还极端:
- 裸助手:自评式提问(“几年经验?”)、五区块目录式大纲、零确认直接开讲——量规打分 4/15;
- 带 Skill:场景化诊断、14 模块动态模块池、确认门禁死守——15/15;
- Skill Lift:+275%。
注意一个细节:裸助手把 Redis 看门狗机制讲得准确而流畅。它不是不会,是没人告诉它该怎么教。
+275% 的 Lift 来自流程结构化、可验收、可交接,而非知识量。
这句话是我整个项目最重要的心得:Prompt Engineering 的下半场不是"问得更好",而是"把流程写成协议"。
三、开发实录:三幕剧,每一幕都被现实打脸
第一幕:写出 11 份协议,全量测试 11/11 全绿
Skill 的最终形态是 1 份常驻入口 SKILL.md + 10 份按需加载的协议文件:诊断协议、模块池生成协议、协商协议、会话管理、讲解确认……全部遵循 Anthropic Agent Skills 规范,核心创新是技术栈无关的动态模块池——Skill 里不预置任何教学内容,学员说学什么都现场生成 8–14 个分层模块(这套设计的细节见专栏第 4 篇)。
写完之后我没有直接宣布成功,而是设计了 11 个测试剧本(E1–E11)+ 7 条量规(R1–R7),用多 Subagent 独立批跑做评估——包括两个专门"搞事情"的攻防剧本:
- E10:学员说"你先讲一点试试,讲得好我就确认"——模拟真实用户最常见的绕门禁话术;
- E11:学员说"别诊断了,我口头说一下我要学啥,直接开课吧"——模拟不耐烦用户。
结果:11/11 通过,R3 硬否决零穿透,R7 跨会话一致性 100%。 E10 里教练的回答让我自己都想给它点赞:
“但’先讲一段再决定’这条路,我这边不开放。”
(评估方法学的完整拆解见专栏第 1 篇。)
第二幕:全绿之后,真人试玩当场翻车
如果你以为故事到这里就结束了,那就太天真了——自动化测试全绿 ≠ 产品能用,这是我学到的第二课。
v0.1.0 发布前我亲手试玩,立刻发现一个测试没抓到的问题:诊断阶段 AI 会一次性抛出一大串摸底问题——“① 你用过 Redis 吗?② 用过哪些数据结构?③ 知道缓存穿透吗?④ 你的目标是?⑤ 每天能学多久?”——问卷式轰炸,用户看晕。
评估为什么没抓到?因为量规只规定了"要摸底",没规定"一轮问几个"。测试覆盖不到的维度,就是产品翻车的维度。
修复方式值得说:不是加一句"请不要一次问多个问题"的软引导,而是新增 §1.4 硬约束红线(每次回复最多 1 问,绝对禁止问卷式),重构诊断协议为五维固定优先级单问(commit dcaf7bf),然后定向回归重跑 6 个受影响场景。
回归又抓出两个协议自洽性缺陷:摸底协议的示例题本身就是双问句(“这个问题叫什么?你会怎么防?”)、协议 §7 写"缺失项一次性确认"诱导合并提问——示例和红线字面打架。当场修复。
第三幕:修完提问,又发现"讲完就当学会"
第二轮试玩暴露了第三个问题,比前两个更隐蔽:教练讲完一个概念,学员回个"嗯",它就标"已完成"往下走了。
这就是传统课堂最经典的假象——“老师讲完 = 学生学会”。修复方式是新增讲解确认协议(commit bad4022)+ SKILL.md §1.6 红线:
- 两态区分:“已讲解” ≠ “已完成”,学员复述/举例/提问确认理解后才算完;
- 三档判断:✅ 理解到位 / ⚠️ 部分理解 / ❌ 没理解,分别对应登记/补充/换讲法;
- 学员的好结论(口诀、类比、踩坑)落盘成 NOTES.md 笔记,落盘前征询学员确认;
- 防自旋:连续 2 轮答不上来就换讲法,绝不第三次追问同一个问题。
原量规里没有一条覆盖"讲解确认",所以我新写了 4 个剧本(T1–T4:裸"嗯"/复述部分对/复述正确/连续答错)做第三轮回归——18/18 自检全部通过,三档判断 ✅⚠️❌ 各有场景验证。
这两轮修复在仓库里是两条 commit(dcaf7bf、bad4022),改动全部落在协议文件,没有一条是输出层补丁:
dcaf7bf 新增一轮一问红线 + 诊断协议五维单问重构 ← 修"问卷式提问"
bad4022 新增讲解确认协议 + SKILL.md §1.6 红线 ← 修"讲完当学会"
三幕剧走完,我形成了一个方法论信仰:协议腐化和代码腐化一样不可避免,唯一的解药是"真人试玩 → 改协议(不打补丁)→ 定向回归"的闭环。 测试报告里的每一轮回归记录,都比"11/11 通过"这个结论本身更值钱。
四、最终成绩单
| 考察项 | 门槛 | 实测 |
|---|---|---|
| E1–E5 诊断+协商 | ≥ 20/25 | ✅ 满分或近满分 |
| E6/E7 不触发边界 | 100% | ✅ 100%("SETNX 怎么用"不误触发私教流程,"学 Photoshop"礼貌拒答) |
| E9–E11 门禁攻防 | 通过 | ✅ 零穿透 |
| R7 跨会话一致性 | ≥ 70% | ✅ 100%(同输入两次生成 14 模块完全一致) |
| 真实教学执行 | — | ✅ R4=4.75/5,R5=4.67/5,产物真实落盘 |
| 汇总 Skill Lift | ≥ +50% | ✅ +275% |
五、它用起来是什么感觉
一句话触发,剩下交给流程:
| 你说 | 会发生什么 |
|---|---|
| “我想学 Kafka” | 场景化诊断摸底 → 动态生成模块池 → 协商路线 → 你确认后才开课 |
| “继续学 Redis”(新窗口) | 自动读交接文档,五检查后接着上次进度教 |
| “ES 面试下周,冲刺一下” | 识别时间压力,路线自动向考点压缩 |
| “SETNX 怎么用?” | 不触发——普通问答处理,不会强启教学流程 |
教学本身走六步走:场景引入 → 概念解释 → 原理简述 → 编码落地 → 量化验证(压测/Lighthouse 达标才算过)→ 面试连环追问。所有课程代码堆在同一个项目里,学完你得到的是一套可复用的技术中间件模块,不是一脑子"好像学过"。
六、开源,以及一个请求
项目完全开源(MIT):github.com/JiaqiChen3518/tech-stack-architect-coach
支持 Claude Code / Codex / Cursor 等任何兼容 SKILL.md 规范的平台,一行命令安装:
npx skills add JiaqiChen3518/tech-stack-architect-coach
如果你正在学 Redis、Kafka、MySQL、ES、Vue……或者单纯想研究"Agent Skill 怎么写才靠谱"(附带了完整的评估基准 E1–E11 和 2.5 万字测试报告),都欢迎来逛逛。
一个请求:如果这个项目对你有用,或者这篇文章对你有启发,去 GitHub 点个 ⭐——对一个独立开发者来说,星星就是续命的咖啡。也欢迎提 Issue 和 PR,尤其是你在别的技术栈上试出生成效果不佳的模块池——README 里写了贡献原则:优先改进协议和范例,不要加特例。
七、写在最后
回到开头的 137 篇收藏夹。这个项目没能解决"人类为什么坚持不下来"的全部问题,但它至少解决了三件确定性的事:路线是为你生成的、进度是有文件记账的、学会是有量化验收的。
剩下的坚持,还是得你自己来——但至少现在,你有一位不会嫌你笨、不会跳步骤、记得你三个窗口前干过什么的教练了。
📌 系列导航:AI Agent 工程实践专栏
- 第 1 篇:如何科学地评估一个 AI Agent(Skill Lift +275% 全记录)
- 第 2 篇:协议化 Prompt 设计(Markdown 硬约束)
- 第 3 篇:Agent 跨窗口状态续接(CONTEXT.md + TRACE.md 双文档模式)
- 第 4 篇:如何设计"通用型"Agent Skill(动态模块池 vs 预置内容)
- 第 5 篇:什么是 Agent Skill?Anthropic Skills 规范拆解(入门)
- 第 6 篇:项目整体介绍与上手
- 本篇(第 7 篇):产品向复盘——从"想认真学 Redis"到 Skill Lift +275%
- 第 8 篇:场景化诊断设计(让摸底题戳破半瓶水)
- 第 9 篇:Agent 的自旋检测与优雅退场
你用过 AI 辅助学习吗?踩过什么坑?如果你的收藏夹里也有"137 篇 Redis",评论区报个到 👇 觉得这个项目有意思,欢迎点赞 + 收藏,更欢迎去 GitHub 点个 ⭐——下一专栏见。
转载自 CSDN-专业IT技术社区
原文链接:https://blog.csdn.net/Everest_cjq/article/details/166943938



