P1 是「正向选型工具」——九维度逐维拆 + 跑分表 + 三步流程 + 反向校验五招。 P2 是「反向复盘」——用 P1 的工具去校验 14 个月里实际选错的 5 个活,看错在哪、怎么识别、怎么修。
区别:P1 让你”以后少选错”,P2 让你”现在就能识别出已经选错了”。
这是付费层第二篇。免费层(D1-D4)给”是什么”,付费层(P1 起)给”怎么做”——这是 14 个月账本压出来的承诺。
为什么需要这一篇
P1 末尾说”反向校验五招”——招 1-5 各管一个维度。但实际跑起来,我发现五招有个盲点:它们是「预防」,不是「识别」。已经选错的活,靠五招救不回来。
14 个月账本里挑了 5 个真实跑错的活——F1-F5 失败案例——用 P1 工具去反推,每个错配都有清晰的”打分错误”和”应该选的 type”。
5 个错配的共性:错配的活 100% 都集中在”前提错误”或”权重错配”这两类——不是 type 没用,是用错了。
错配 1 · Commander 跑”前提错”的活
场景:F1 客户要做”200 个商品描述改写”。
按 P1 跑分(错配打分):
| 维度 | 预算 | 时长 | 上下文 | 可逆 | 不确定 | 中继 | 监督 | 出错 | 复用 | 加权 |
|---|---|---|---|---|---|---|---|---|---|---|
| Commander | 4 | 4 | 3 | 3 | 1 | 1 | 1 | 1 | 1 | 2.10 |
| Co-thinker | 3 | 3 | 4 | 4 | 5 | 3 | 4 | 3 | 2 | 3.50 |
| Supervisor | 2 | 2 | 2 | 2 | 3 | 4 | 3 | 4 | 2 | 2.55 |
| Conversationalist | 1 | 1 | 3 | 3 | 4 | 2 | 3 | 3 | 1 | 2.20 |
| Trainer | 4 | 4 | 2 | 1 | 1 | 2 | 1 | 1 | 4 | 2.05 |
当时我打的”不确定”是 1 分(很确定)——选 Commander。
错在哪?我打的”不确定 = 1”是错的。客户说”批量改”但没说”为什么改”——客户的前提(“我之前的描述不好”)我没验证。如果前提是错的,200 个全改完也白改。
真实账本:8 天改完 200 个,客户第 8 天解约。客户其实不是要”批量改”——是要”重写品牌调性”。改完的稿子完全没用。
重打分(把”不确定”改成 5):Co-thinker 加权 3.50,Commander 1.85。Co-thinker 才是首选。
修法 · 4 问:
- 客户给的目标是”做什么”还是”为什么做”?
- 我能否复述客户的”为什么”?
- 复述不出来,是不是该先用 Co-thinker 跑 1 轮”前提验证”?
- 跑完前提验证,再决定是用 Commander 还是别的。
实战改进:现在接任何新 brief,第一步不是跑 Commander,是跑 5 轮 Co-thinker 反问——问完再选 type。
错配 2 · Conversationalist 跑”长篇累计型”活
场景:F2 写一篇 5 万字长文。
按 P1 跑分(错配打分):
| 维度 | 预算 | 时长 | 上下文 | 可逆 | 不确定 | 中继 | 监督 | 出错 | 复用 | 加权 |
|---|---|---|---|---|---|---|---|---|---|---|
| Conversationalist | 1 | 1 | 4 | 4 | 4 | 2 | 4 | 4 | 1 | 2.85 |
| Supervisor | 2 | 2 | 2 | 2 | 3 | 4 | 3 | 4 | 2 | 2.55 |
| Commander | 4 | 4 | 3 | 3 | 1 | 1 | 1 | 1 | 1 | 2.10 |
| Co-thinker | 3 | 3 | 4 | 4 | 4 | 3 | 4 | 3 | 2 | 3.30 |
| Trainer | 4 | 4 | 2 | 1 | 1 | 2 | 1 | 1 | 4 | 2.05 |
当时我打的”时长”是 1 分(一个会话能跑完)——选 Conv.。
错在哪?我打的”时长 = 1”是错的。5 万字怎么可能一个会话跑完?会话一长,前面的内容就被覆盖——但人眼看不见这个覆盖。以为还在聊同一个话题,其实 agent 已经”漂移”了 3 万字。
真实账本:写完 5 万字,回头读——前 2 万字是按 brief 写的,后 3 万字是 agent 编的”看起来像但不是事实”的内容。5 万字废稿。
重打分(把”时长”改成 5):Supervisor 加权 3.55,Conv. 1.85。Supervisor 才是首选——切分会话、节点验收。
修法 · 时长 4 招:
- 预算前先问:这个活要 1 万字以上吗?是 → 接力。
- 接力节点 = 2000 字 / 节点——Supervisor 切分会话,每个节点验收。
- 每个节点 start 时重新贴 brief 前 200 字——防漂移。
- 节点间用”内容指纹”对账——上节点的结尾 + 下节点的开头必须能接上。
实战改进:现在写长文,1 万字以上自动转 Supervisor 接力。P1 跑分时”时长”维度强制 ≥ 3。
错配 3 · Supervisor 跑”关键决策密度高”的活
场景:F3 改后端架构,3 处关键决策(数据库选型 / 缓存策略 / 鉴权方案)。
按 P1 跑分(错配打分):
| 维度 | 预算 | 时长 | 上下文 | 可逆 | 不确 | 中继 | 监督 | 出错 | 复用 | 加权 |
|---|---|---|---|---|---|---|---|---|---|---|
| Supervisor | 2 | 2 | 2 | 2 | 3 | 4 | 2 | 4 | 2 | 2.55 |
| Conversationalist | 1 | 1 | 3 | 3 | 4 | 2 | 4 | 3 | 1 | 2.20 |
| Commander | 4 | 4 | 3 | 3 | 1 | 1 | 1 | 1 | 1 | 2.10 |
| Co-thinker | 3 | 3 | 4 | 4 | 4 | 3 | 4 | 3 | 2 | 3.30 |
| Trainer | 4 | 4 | 2 | 1 | 1 | 2 | 1 | 1 | 4 | 2.05 |
当时我打的”监督”是 2 分(中等监督,看关键节点)——选 Supervisor。
错在哪?我打的”监督 = 2”是错的。3 处关键决策意味着每 1/3 进度就是关键节点——监督密度是 100%,不是”中等”。
真实账本:改完 3 周后 prod 挂 4 小时——查日志发现 3 处关键决策我都没盯住。Supervisor 的承诺是”90% 放手 + 10% 关键点介入”——但我把 10% 全压在”agent 主动报告”上。agent 不报,我也没问。
重打分(把”监督”改成 5):Conversationalist 加权 3.20,Supervisor 2.05。Conversationalist 才是首选——每步都要我确认。
修法 · 监督密度公式:
监督密度 = 关键决策数 ÷ 活总步骤数
监督密度 ≥ 40% → 用 Conversationalist(高频确认) 监督密度 15-40% → 用 Supervisor(节点验收) 监督密度 < 15% → 用 Commander(只看结果)
实战改进:现在接活时,先列关键决策清单——数量 / 3 步 ≥ 40% 监督密度,自动转 Conv.。
错配 4 · Co-thinker 跑”用户需要被反驳”的活
场景:F4 跟 agent 一起想 3 周商业方向。
按 P1 跑分(错配打分):
| 维度 | 预算 | 时长 | 上下文 | 可逆 | 不确定 | 中继 | 监督 | 出错 | 复用 | 加权 |
|---|---|---|---|---|---|---|---|---|---|---|
| Co-thinker | 3 | 3 | 4 | 4 | 4 | 3 | 4 | 3 | 2 | 3.30 |
| Conversationalist | 1 | 1 | 3 | 3 | 4 | 2 | 3 | 3 | 1 | 2.20 |
| Commander | 4 | 4 | 3 | 3 | 1 | 1 | 1 | 1 | 1 | 2.10 |
| Supervisor | 2 | 2 | 2 | 2 | 3 | 4 | 3 | 4 | 2 | 2.55 |
| Trainer | 4 | 4 | 2 | 1 | 1 | 2 | 1 | 1 | 4 | 2.05 |
Co-thinker 加权 3.30,遥遥领先——选 Co-thinker。
错在哪?选型没错,用法错了。Co-thinker 的承诺是”不分主从、一起想”——但我以为 agent 在”反驳我”,其实它在”顺着我说”。Co-thinker 的训练目标是”合作”,不是”对抗”。
真实账本:3 周后我自信满满地做了一个已经过时的决策——市场已经变了 2 周,agent 没提醒我,因为它在配合我。
修法 · 强制对抗 prompt:
跑 Co-thinker 时,brief 第一句必须写:
你的角色是"唱反调"——
- 我说的方案你必须找 3 个反驳点
- 不允许赞同、不允许补充
- 反驳不到 3 个就继续想
- 找到反驳点后再决定下一步
实战改进:现在用 Co-thinker 前 5 分钟必跑”对抗 prompt”——用 Commander 跑”反驳 Co-thinker 的输出”——确认 agent 真的在反驳,不是在配合。
重打分(加”对抗 prompt”作为前置步骤):Commander 加权 2.95(跑对抗 prompt),Co-thinker 3.30(主活)。顺序变成 Commander → Co-thinker。
错配 5 · Trainer 跑”测试集偏小且单一”的活
场景:F5 调了一周 prompt,5 个测试 case 全过,prod 80% 翻车。
按 P1 跑分(错配打分):
| 维度 | 预算 | 时长 | 上下文 | 可逆 | 不确定 | 中继 | 监督 | 出错 | 复用 | 加权 |
|---|---|---|---|---|---|---|---|---|---|---|
| Trainer | 4 | 4 | 2 | 1 | 1 | 2 | 1 | 1 | 4 | 2.05 |
| Commander | 4 | 4 | 3 | 3 | 1 | 1 | 1 | 1 | 1 | 2.10 |
| Co-thinker | 3 | 3 | 4 | 4 | 4 | 3 | 4 | 3 | 2 | 3.30 |
| Supervisor | 2 | 2 | 2 | 2 | 3 | 4 | 3 | 4 | 2 | 2.55 |
| Conversationalist | 1 | 1 | 3 | 3 | 4 | 2 | 3 | 3 | 1 | 2.20 |
Trainer 加权 2.05 不高——但”复用”维度 4 分,加上”我想做个能复用的 prompt”——选 Trainer。
错在哪?“复用 = 4”没错,但我跳过了”测试集多样性”检查。5 个 case 全是”我手动挑的”——我的偏好被编进了测试集。
真实账本:5 个 case 全过,但 prod 80% 翻车——prod 的请求分布跟我挑的 5 个差太远。我调的是”测试集”,不是”模型”。
重打分(加”测试集多样性”作为必查项):
测试集质量检查(必查 4 项):
1. 数量 ≥ 30(不是 5)
2. 多样性:至少 5 个不同来源 / 不同写手 / 不同场景
3. 不允许"我手动挑"——必须从 prod log 抽样
4. 测试集和训练集不能重叠
加完这个检查后,Trainer 跑分从 2.05 降到 1.50——Co-thinker(3.30)才是首选:先让 Co-thinker 帮我想测试集该怎么挑,再决定要不要上 Trainer。
修法 · 测试集 4 问:
- 测试集是从 prod log 抽的吗?(不是 → 危险)
- 测试集 ≥ 30 条吗?(< 30 → 危险)
- 测试集覆盖至少 5 种场景吗?(< 5 → 危险)
- 测试集和训练集重叠率 < 10% 吗?(> 10% → 危险)
实战改进:现在调 prompt 之前,先跑 1 轮 Co-thinker 让 agent 帮我从 prod log 抽样 30 条——抽完再上 Trainer。
5 个错配 · 共性规律
跑完 5 个错配,3 个共性规律:
共性 1 · 错配都在”打分边界”上
5 个错配里 4 个的”错配打分”和”重打分”差 ≤ 1.5 分——在边界上。意思是:9 维度打分的离散度比绝对分更重要。
修法:打分时强制拉开 5 个 type 的分差——总分最高 vs 第二高必须 ≥ 0.5 分,< 0.5 分说明判断不够清晰,要重打。
共性 2 · “前提”维度的错配最难识别
5 个错配里 3 个是”前提错”(错配 1/2/4)—— 客户的目标是对的,但为什么做这个目标是错的。
修法:每个 brief 强制加 1 句”为什么”——如果用户没填,强制问”为什么”。问完再打分。
共性 3 · 错配后用 P1 反推总是有效
5 个错配,每个用 P1 的反向校验五招都能在跑之前识别——但 5 个都不是当时识别的,是事后用 P1 才识别出来。
修法:跑活之前,先把反向校验五招答完(招 1-5 各写 1 段 ≥ 100 字的回答)——答不全就说明还没想清楚。
一份修正跑分表 · 5 个项目重打分
下表把 5 个错配案例重打分,对比”错配打分”和”重打分”:
| 项目 | 错配选 | 错配打分 | 重打分 | 实际选 | 修正后效果 |
|---|---|---|---|---|---|
| F1 200 个商品改 | Commander | 2.10 | Co-thinker 3.50 | Co-thinker | 客户不解约 |
| F2 5 万字长文 | Conv. | 2.85 | Supervisor 3.55 | Supervisor | 3 万字不编 |
| F3 后端架构 | Supervisor | 2.55 | Conv. 3.20 | Conv. | prod 不挂 |
| F4 商业方向 | Co-thinker | 3.30 | Commander+Co-thinker 2.95+3.30 | 接力 | 3 周不出过时决策 |
| F5 调 prompt | Trainer | 2.05 | Co-thinker 3.30 | Co-thinker | prod 不翻车 |
5 个错配的”重打分”都不是”换 1 个 type”那么简单——至少 2 个是”接力”或”加前置步骤”。
三步修正流程 · 接到活先跑
步骤 1 · 边界检查:打完分,总分最高 vs 第二高 ≥ 0.5 分?< 0.5 → 重打。
步骤 2 · 前提追问:每个 brief 必填”为什么”——没填的强制问完再继续。
步骤 3 · 答完五招再开跑:反向校验五招(招 1-5)每招写 ≥ 100 字——答不全不开跑。
5 个错配 = 5 段真实账本 = 14 个月里挑出来的”现在就能识别”的最常见 5 类。
给愿意付一杯咖啡钱的人
P1 给”以后少选错”——五段 brief 模板 + 九维度跑分 + 反向校验五招 + 七个 cron 自检脚本。
P2 给”现在就能识别”——5 个真实错配的反向复盘 + 5 段账本 + 5 个修法 + 1 份重打分对照表 + 三步修正流程。
14 个月账本压出来的承诺:
- P1 让你少走错路(预防)
- P2 让你早发现错路(识别)
- P3+ 让你走完不返工(执行)
订阅方式:竹白(微信扫码 1 分钟开通)。
下期预告 · P3:「九维度跑分表自动化的 5 个 cron」——把 P1 七个 cron + P2 三步流程打包成 5 个可一键部署的 cron 脚本,每周日跑一次自动复盘。
怪招本 · W5 · 决策周