Skip to content

V1.0-Human 真人 review 模板 (Plan C #9)

目的: 把每个 skill 从 AI 自评+AI 自定加权 (v0.5-alpha) 升级到真人跑过的 v1.0-Human。 何时用: 每次新功能上线前 / 季度复盘 / 客户验收时。


0. 评审元数据

评审 ID:        v1.0-human-{SKILL}-{日期}
skill 名:        ecc-vert-case / agent-knowledge-task / agent-benchmark-lab
评审人:         ___ (签名: ___)
日期:           YYYY-MM-DD
skill 当前版本: v0.5-alpha
关联 release:   v0.9.0 (https://github.com/chunxiaoxx/nautilus-FDE/releases)

1. 触发词匹配 (3 分)

[ ] 一句话触发 skill 成功 (说 "我做..." 1 次 → 立即 invoke)
[ ] 触发词列表覆盖 ≥80% 业务场景
[ ] 误触发率 < 5% (10 个无关 prompt 测试)

2. 9 维度审计 (54 分, 每维度 0-6 分)

维度 评分 (0-6) 证据
1. 数据真实性 (没 AI 模拟数据)
2. 5P0 审计 (0 P0 通过)
3. 知识深度 (领域专家 review)
4. 可教学性 (新人用 1 小时能跑通)
5. 复现性 (同 prompt 跑 3 次结果一致)
6. 文档完整 (没 TODO 缺位)
7. 错误处理 (有 graceful degradation)
8. 性能 (单跑 < 5 min, 批跑 < 30 min)
9. 业务价值 (客户会付钱吗)
合计 /54 = (9 维平均 × 9) / 6 → v1.0 需 ≥ 4.0

3. 端到端跑 1 个真实项目 (15 分)

项目名:        ___
项目类型:      (出题/教案/评测) 之一
跑流程:        git clone → 装 → run.py → 测
耗时:          ___ 分钟
碰到的坑:      ___
是否跑通:      Y / N
产出物:        (zip/HTML/Bitable)

4. 跨业务一致性 (10 分)

跨 skill 是否一致? Y / N 备注
5P0 评分标准
9 维度审计方法
错误码体系
日志格式
飞书 base 接入

5. 已知 P0 (必须修才能发 v1.0)

[ ] P0-1: ___
[ ] P0-2: ___
[ ] P0-3: ___

6. 已知 P1 (应该修, 不阻塞 v1.0)

[ ] P1-1: ___
[ ] P1-2: ___

7. 改进建议 (真人视角)

1. ___
2. ___
3. ___

8. 签名 + 日期

评审人签字:    _____________
日期:          YYYY-MM-DD
建议:          □ 准发 v1.0    □ 需改 P0 后重评    □ 需 P1 全修才能发

3 个 skill 的 v1.0-Human 报告 (待回填)

skill 评审人 日期 总分 准发
ecc-vert-case (第一类) ___ TBD /54
agent-knowledge-task (第二类) ___ TBD /54
agent-benchmark-lab (第三类) ___ TBD /54

测试用例库 (供 3 评审人参考)

第一类 (ecc-vert-case)

  • 跑 V5-benchmark 12 案例 (V5-benchmark 来自 V5-benchmark zip)
  • 验证: 9 维度审计都 ≥ 4.0, P0 都通过
  • 产出: agent_benchmark_lab_delivery_YYYYMMDD.zip

第二类 (agent-knowledge-task)

  • 跑 6 领域 (工程/医疗/法律/金融/农业/其他) 各 1 个子方向
  • 验证: 知识密度 ≥ 5 个知识点/案例, 推理链完整
  • 产出: agent_knowledge_task_dashboard_YYYYMMDD.html

第三类 (agent-benchmark-lab)

  • 跑 18 task (6 类 L3) 各 1 个
  • 验证: pass@k 准确, 评测报告完整
  • 产出: agent_benchmark_lab_eval_report_YYYYMMDD.md