首页 决策 N° P2
P2 paid · 付费层首篇
A P1 正向
B P2 反向

九维度跑分的五个错配:怎么识别 + 怎么修(付费层 · 第二篇)

verdict 5 错配识别 + 重打分 + 修法 · F1-F5 真实账本 · 3 步修正流程

P1 给了正向的九维度拆解 + 跑分表 + 三步流程 + 反向校验五招。这一篇把 14 个月账本里挑出的 5 个真实错配——用 P1 工具去校验原本选错的 type——给出「错配 → 重打分 → 选对」的完整复盘。每个错配 1 段真实账本 + 1 段重打分 + 1 个修法。这是付费层第二篇,给愿意为「不再选错」付一杯咖啡钱的人。

2026-08-04 · 20 分钟阅读 阅读 · DEEP DIVE · 付费层

五个错配场景 · 应该选 vs 实际跑 · 九维度反向校验

P1 是「正向选型工具」——九维度逐维拆 + 跑分表 + 三步流程 + 反向校验五招。 P2 是「反向复盘」——用 P1 的工具去校验 14 个月里实际选错的 5 个活,看错在哪、怎么识别、怎么修。

区别:P1 让你”以后少选错”,P2 让你”现在就能识别出已经选错了”。

这是付费层第二篇。免费层(D1-D4)给”是什么”,付费层(P1 起)给”怎么做”——这是 14 个月账本压出来的承诺。

为什么需要这一篇

P1 末尾说”反向校验五招”——招 1-5 各管一个维度。但实际跑起来,我发现五招有个盲点:它们是「预防」,不是「识别」。已经选错的活,靠五招救不回来。

14 个月账本里挑了 5 个真实跑错的活——F1-F5 失败案例——用 P1 工具去反推,每个错配都有清晰的”打分错误”和”应该选的 type”。

5 个错配的共性:错配的活 100% 都集中在”前提错误”或”权重错配”这两类——不是 type 没用,是用错了。


错配 1 · Commander 跑”前提错”的活

场景:F1 客户要做”200 个商品描述改写”。

按 P1 跑分(错配打分):

维度预算时长上下文可逆不确定中继监督出错复用加权
Commander4433111112.10
Co-thinker3344534323.50
Supervisor2222343422.55
Conversationalist1133423312.20
Trainer4421121142.05

当时我打的”不确定”是 1 分(很确定)——选 Commander。

错在哪?我打的”不确定 = 1”是错的。客户说”批量改”但没说”为什么改”——客户的前提(“我之前的描述不好”)我没验证。如果前提是错的,200 个全改完也白改。

真实账本:8 天改完 200 个,客户第 8 天解约。客户其实不是要”批量改”——是要”重写品牌调性”。改完的稿子完全没用。

重打分(把”不确定”改成 5):Co-thinker 加权 3.50,Commander 1.85。Co-thinker 才是首选

修法 · 4 问

  1. 客户给的目标是”做什么”还是”为什么做”?
  2. 我能否复述客户的”为什么”?
  3. 复述不出来,是不是该先用 Co-thinker 跑 1 轮”前提验证”?
  4. 跑完前提验证,再决定是用 Commander 还是别的。

实战改进:现在接任何新 brief,第一步不是跑 Commander,是跑 5 轮 Co-thinker 反问——问完再选 type。


错配 2 · Conversationalist 跑”长篇累计型”活

场景:F2 写一篇 5 万字长文。

按 P1 跑分(错配打分):

维度预算时长上下文可逆不确定中继监督出错复用加权
Conversationalist1144424412.85
Supervisor2222343422.55
Commander4433111112.10
Co-thinker3344434323.30
Trainer4421121142.05

当时我打的”时长”是 1 分(一个会话能跑完)——选 Conv.。

错在哪?我打的”时长 = 1”是错的。5 万字怎么可能一个会话跑完?会话一长,前面的内容就被覆盖——但人眼看不见这个覆盖。以为还在聊同一个话题,其实 agent 已经”漂移”了 3 万字。

真实账本:写完 5 万字,回头读——前 2 万字是按 brief 写的,后 3 万字是 agent 编的”看起来像但不是事实”的内容。5 万字废稿。

重打分(把”时长”改成 5):Supervisor 加权 3.55,Conv. 1.85。Supervisor 才是首选——切分会话、节点验收。

修法 · 时长 4 招

  1. 预算前先问:这个活要 1 万字以上吗?是 → 接力。
  2. 接力节点 = 2000 字 / 节点——Supervisor 切分会话,每个节点验收。
  3. 每个节点 start 时重新贴 brief 前 200 字——防漂移。
  4. 节点间用”内容指纹”对账——上节点的结尾 + 下节点的开头必须能接上。

实战改进:现在写长文,1 万字以上自动转 Supervisor 接力。P1 跑分时”时长”维度强制 ≥ 3。


错配 3 · Supervisor 跑”关键决策密度高”的活

场景:F3 改后端架构,3 处关键决策(数据库选型 / 缓存策略 / 鉴权方案)。

按 P1 跑分(错配打分):

维度预算时长上下文可逆不确中继监督出错复用加权
Supervisor2222342422.55
Conversationalist1133424312.20
Commander4433111112.10
Co-thinker3344434323.30
Trainer4421121142.05

当时我打的”监督”是 2 分(中等监督,看关键节点)——选 Supervisor。

错在哪?我打的”监督 = 2”是错的。3 处关键决策意味着每 1/3 进度就是关键节点——监督密度是 100%,不是”中等”。

真实账本:改完 3 周后 prod 挂 4 小时——查日志发现 3 处关键决策我都没盯住。Supervisor 的承诺是”90% 放手 + 10% 关键点介入”——但我把 10% 全压在”agent 主动报告”上。agent 不报,我也没问。

重打分(把”监督”改成 5):Conversationalist 加权 3.20,Supervisor 2.05。Conversationalist 才是首选——每步都要我确认。

修法 · 监督密度公式

监督密度 = 关键决策数 ÷ 活总步骤数

监督密度 ≥ 40% → 用 Conversationalist(高频确认) 监督密度 15-40% → 用 Supervisor(节点验收) 监督密度 < 15% → 用 Commander(只看结果)

实战改进:现在接活时,先列关键决策清单——数量 / 3 步 ≥ 40% 监督密度,自动转 Conv.。


错配 4 · Co-thinker 跑”用户需要被反驳”的活

场景:F4 跟 agent 一起想 3 周商业方向。

按 P1 跑分(错配打分):

维度预算时长上下文可逆不确定中继监督出错复用加权
Co-thinker3344434323.30
Conversationalist1133423312.20
Commander4433111112.10
Supervisor2222343422.55
Trainer4421121142.05

Co-thinker 加权 3.30,遥遥领先——选 Co-thinker。

错在哪?选型没错,用法错了。Co-thinker 的承诺是”不分主从、一起想”——但我以为 agent 在”反驳我”,其实它在”顺着我说”。Co-thinker 的训练目标是”合作”,不是”对抗”。

真实账本:3 周后我自信满满地做了一个已经过时的决策——市场已经变了 2 周,agent 没提醒我,因为它在配合我。

修法 · 强制对抗 prompt

跑 Co-thinker 时,brief 第一句必须写:

你的角色是"唱反调"——
- 我说的方案你必须找 3 个反驳点
- 不允许赞同、不允许补充
- 反驳不到 3 个就继续想
- 找到反驳点后再决定下一步

实战改进:现在用 Co-thinker 前 5 分钟必跑”对抗 prompt”——用 Commander 跑”反驳 Co-thinker 的输出”——确认 agent 真的在反驳,不是在配合。

重打分(加”对抗 prompt”作为前置步骤):Commander 加权 2.95(跑对抗 prompt),Co-thinker 3.30(主活)。顺序变成 Commander → Co-thinker


错配 5 · Trainer 跑”测试集偏小且单一”的活

场景:F5 调了一周 prompt,5 个测试 case 全过,prod 80% 翻车。

按 P1 跑分(错配打分):

维度预算时长上下文可逆不确定中继监督出错复用加权
Trainer4421121142.05
Commander4433111112.10
Co-thinker3344434323.30
Supervisor2222343422.55
Conversationalist1133423312.20

Trainer 加权 2.05 不高——但”复用”维度 4 分,加上”我想做个能复用的 prompt”——选 Trainer。

错在哪?“复用 = 4”没错,但我跳过了”测试集多样性”检查。5 个 case 全是”我手动挑的”——我的偏好被编进了测试集。

真实账本:5 个 case 全过,但 prod 80% 翻车——prod 的请求分布跟我挑的 5 个差太远。我调的是”测试集”,不是”模型”。

重打分(加”测试集多样性”作为必查项):

测试集质量检查(必查 4 项):
1. 数量 ≥ 30(不是 5)
2. 多样性:至少 5 个不同来源 / 不同写手 / 不同场景
3. 不允许"我手动挑"——必须从 prod log 抽样
4. 测试集和训练集不能重叠

加完这个检查后,Trainer 跑分从 2.05 降到 1.50——Co-thinker(3.30)才是首选:先让 Co-thinker 帮我想测试集该怎么挑,再决定要不要上 Trainer。

修法 · 测试集 4 问

  1. 测试集是从 prod log 抽的吗?(不是 → 危险)
  2. 测试集 ≥ 30 条吗?(< 30 → 危险)
  3. 测试集覆盖至少 5 种场景吗?(< 5 → 危险)
  4. 测试集和训练集重叠率 < 10% 吗?(> 10% → 危险)

实战改进:现在调 prompt 之前,先跑 1 轮 Co-thinker 让 agent 帮我从 prod log 抽样 30 条——抽完再上 Trainer。


5 个错配 · 共性规律

跑完 5 个错配,3 个共性规律

共性 1 · 错配都在”打分边界”上

5 个错配里 4 个的”错配打分”和”重打分”差 ≤ 1.5 分——在边界上。意思是:9 维度打分的离散度绝对分更重要。

修法:打分时强制拉开 5 个 type 的分差——总分最高 vs 第二高必须 ≥ 0.5 分,< 0.5 分说明判断不够清晰,要重打。

共性 2 · “前提”维度的错配最难识别

5 个错配里 3 个是”前提错”(错配 1/2/4)—— 客户的目标是对的,但为什么做这个目标是错的。

修法:每个 brief 强制加 1 句”为什么”——如果用户没填,强制问”为什么”。问完再打分。

共性 3 · 错配后用 P1 反推总是有效

5 个错配,每个用 P1 的反向校验五招都能在跑之前识别——但 5 个都不是当时识别的,是事后用 P1 才识别出来。

修法:跑活之前,先把反向校验五招答完(招 1-5 各写 1 段 ≥ 100 字的回答)——答不全就说明还没想清楚。


一份修正跑分表 · 5 个项目重打分

下表把 5 个错配案例重打分,对比”错配打分”和”重打分”

项目错配选错配打分重打分实际选修正后效果
F1 200 个商品改Commander2.10Co-thinker 3.50Co-thinker客户不解约
F2 5 万字长文Conv.2.85Supervisor 3.55Supervisor3 万字不编
F3 后端架构Supervisor2.55Conv. 3.20Conv.prod 不挂
F4 商业方向Co-thinker3.30Commander+Co-thinker 2.95+3.30接力3 周不出过时决策
F5 调 promptTrainer2.05Co-thinker 3.30Co-thinkerprod 不翻车

5 个错配的”重打分”都不是”换 1 个 type”那么简单——至少 2 个是”接力”或”加前置步骤”。


三步修正流程 · 接到活先跑

步骤 1 · 边界检查:打完分,总分最高 vs 第二高 ≥ 0.5 分?< 0.5 → 重打。

步骤 2 · 前提追问:每个 brief 必填”为什么”——没填的强制问完再继续。

步骤 3 · 答完五招再开跑:反向校验五招(招 1-5)每招写 ≥ 100 字——答不全不开跑。

5 个错配 = 5 段真实账本 = 14 个月里挑出来的”现在就能识别”的最常见 5 类。


给愿意付一杯咖啡钱的人

P1 给”以后少选错”——五段 brief 模板 + 九维度跑分 + 反向校验五招 + 七个 cron 自检脚本。

P2 给”现在就能识别”——5 个真实错配的反向复盘 + 5 段账本 + 5 个修法 + 1 份重打分对照表 + 三步修正流程。

14 个月账本压出来的承诺

  • P1 让你少走错路(预防)
  • P2 让你早发现错路(识别)
  • P3+ 让你走完不返工(执行)

订阅方式:竹白(微信扫码 1 分钟开通)。


下期预告 · P3:「九维度跑分表自动化的 5 个 cron」——把 P1 七个 cron + P2 三步流程打包成 5 个可一键部署的 cron 脚本,每周日跑一次自动复盘。

DECIDED

怪招本 · W5 · 决策周