V1.0-Human 真人 review 模板 (Plan C #9)
目的: 把每个 skill 从 AI 自评+AI 自定加权 (v0.5-alpha) 升级到真人跑过的 v1.0-Human。
何时用: 每次新功能上线前 / 季度复盘 / 客户验收时。
0. 评审元数据
评审 ID: v1.0-human-{SKILL}-{日期}
skill 名: ecc-vert-case / agent-knowledge-task / agent-benchmark-lab
评审人: ___ (签名: ___)
日期: YYYY-MM-DD
skill 当前版本: v0.5-alpha
关联 release: v0.9.0 (https://github.com/chunxiaoxx/nautilus-FDE/releases)
1. 触发词匹配 (3 分)
[ ] 一句话触发 skill 成功 (说 "我做..." 1 次 → 立即 invoke)
[ ] 触发词列表覆盖 ≥80% 业务场景
[ ] 误触发率 < 5% (10 个无关 prompt 测试)
2. 9 维度审计 (54 分, 每维度 0-6 分)
| 维度 |
评分 (0-6) |
证据 |
| 1. 数据真实性 (没 AI 模拟数据) |
|
|
| 2. 5P0 审计 (0 P0 通过) |
|
|
| 3. 知识深度 (领域专家 review) |
|
|
| 4. 可教学性 (新人用 1 小时能跑通) |
|
|
| 5. 复现性 (同 prompt 跑 3 次结果一致) |
|
|
| 6. 文档完整 (没 TODO 缺位) |
|
|
| 7. 错误处理 (有 graceful degradation) |
|
|
| 8. 性能 (单跑 < 5 min, 批跑 < 30 min) |
|
|
| 9. 业务价值 (客户会付钱吗) |
|
|
| 合计 |
/54 |
= (9 维平均 × 9) / 6 → v1.0 需 ≥ 4.0 |
3. 端到端跑 1 个真实项目 (15 分)
项目名: ___
项目类型: (出题/教案/评测) 之一
跑流程: git clone → 装 → run.py → 测
耗时: ___ 分钟
碰到的坑: ___
是否跑通: Y / N
产出物: (zip/HTML/Bitable)
4. 跨业务一致性 (10 分)
| 跨 skill 是否一致? |
Y / N |
备注 |
| 5P0 评分标准 |
|
|
| 9 维度审计方法 |
|
|
| 错误码体系 |
|
|
| 日志格式 |
|
|
| 飞书 base 接入 |
|
|
5. 已知 P0 (必须修才能发 v1.0)
[ ] P0-1: ___
[ ] P0-2: ___
[ ] P0-3: ___
6. 已知 P1 (应该修, 不阻塞 v1.0)
[ ] P1-1: ___
[ ] P1-2: ___
7. 改进建议 (真人视角)
8. 签名 + 日期
评审人签字: _____________
日期: YYYY-MM-DD
建议: □ 准发 v1.0 □ 需改 P0 后重评 □ 需 P1 全修才能发
3 个 skill 的 v1.0-Human 报告 (待回填)
| skill |
评审人 |
日期 |
总分 |
准发 |
| ecc-vert-case (第一类) |
___ |
TBD |
/54 |
□ |
| agent-knowledge-task (第二类) |
___ |
TBD |
/54 |
□ |
| agent-benchmark-lab (第三类) |
___ |
TBD |
/54 |
□ |
测试用例库 (供 3 评审人参考)
第一类 (ecc-vert-case)
- 跑 V5-benchmark 12 案例 (V5-benchmark 来自 V5-benchmark zip)
- 验证: 9 维度审计都 ≥ 4.0, P0 都通过
- 产出: agent_benchmark_lab_delivery_YYYYMMDD.zip
第二类 (agent-knowledge-task)
- 跑 6 领域 (工程/医疗/法律/金融/农业/其他) 各 1 个子方向
- 验证: 知识密度 ≥ 5 个知识点/案例, 推理链完整
- 产出: agent_knowledge_task_dashboard_YYYYMMDD.html
第三类 (agent-benchmark-lab)
- 跑 18 task (6 类 L3) 各 1 个
- 验证: pass@k 准确, 评测报告完整
- 产出: agent_benchmark_lab_eval_report_YYYYMMDD.md