Eval Harness(评估框架)
在真实工作中系统化评估 AI 效果的方法论和实践框架。区分专业用户和普通用户的**分水岭**——前者用数据,后者凭感觉。
生产方式:人写签发:晓黎学习复核:2026年7月7日被 4 个词条引用
一句话定义
Eval Harness = 把"我觉得这个模型/工具/prompt 好不好用"转化为可测量、可复现、可比较的评估流程。
普通用户 vs 专业用户
| 普通用户 | 专业用户 |
|---|---|
| 我觉得这个模型更聪明 | 这个模型在 X 任务上完成率 87%,人工修改量减少 40% |
| 这个工具挺好用的 | 这个工具在 Y 场景下输出采用率 65%,平均耗时 3.2 分钟 |
| 这个 prompt 效果不错 | 这个 prompt 在 30 个测试样本上稳定复现率 92% |
| 模型升级后感觉变强了 | 模型升级后 A 类任务提升 12%,B 类任务退化 5% |
六步 Eval 框架
- 真实任务取样 — 不是随便找几个问题,而是从真实工作流中选代表性任务
- 指标定义 — 准确率、完成率、人工修改量、耗时、成本、失败类型
- Golden Set 建设 — 为高频任务建立标准答案、评分标准或人工评审规则
- 对照实验 — A/B test:模型 vs 模型、prompt vs prompt、workflow vs workflow
- 回归测试 — 模型/prompt/工具/workflow 更新后检查是否退化
- 失败案例沉淀 — 系统记录失败类型,形成 failure mode 知识库
与 Benchmark 方法论的区别
| Benchmark 方法论 | Eval Harness |
|---|---|
| 回答:我是否知道如何设计评测? | 回答:我是否真的在工作中持续运行评测? |
| 偏方法论 | 偏实践 |
| 一次性设计 | 持续运行 |
Eval 不是学术专属
日常工作中的 eval:
- 这个模型写文章,人工修改量减少了吗?
- 这个 Agent 写代码,测试通过率是多少?
- 这个 workflow 做调研,事实错误率是多少?
- 模型更新后,原来的工作流有没有退化?
相关概念
- AI Native — Eval 是 L1 第九维度
- Agent Orchestration — 多 Agent 输出的质量需要 eval
- Practice-first Learning Loop — eval 是判断"是否纳入工具栈"的依据
相关笔记
- 模型评估体系与方法论
- Eval实践框架
来源
- 阿迪亚-2026-AI-Native能力Benchmark — D4 Benchmark 方法论 + D9 Eval 运行能力
互链
链接来自概念卡正文里的双链,编译时能解到本期词条集的才成为站内链接。
反链(4)
出处
路径是本地知识库(Obsidian 库)里的位置,正文与概念卡逐字对应。
- 概念卡原文Eval Harness(评估框架)
03_RESOURCES/概念/eval-harness.md - 所属知识地图栏目概念页索引 · Agent 架构与 Harness 治理
03_RESOURCES/概念/Index.md - 正文引用的知识库笔记模型评估体系与方法论
02_AREAS/AI开发/K2-技术方法与实现/优化方法/模型评估体系与方法论.md - 正文引用的知识库笔记Eval实践框架
02_AREAS/AI开发/Eval实践框架.md - 正文引用的知识库笔记阿迪亚-2026-AI-Native能力Benchmark
03_RESOURCES/摘录/adiya-2026-AI-Native-benchmark.md
编译入库:2026年10月6日。词条由知识库编译而来, 修正要回到概念卡改,再重新编译。