Eval Harness(评估框架)

在真实工作中系统化评估 AI 效果的方法论和实践框架。区分专业用户和普通用户的**分水岭**——前者用数据,后者凭感觉。

生产方式:人写签发:晓黎学习复核:2026年7月7日被 4 个词条引用

一句话定义

Eval Harness = 把"我觉得这个模型/工具/prompt 好不好用"转化为可测量、可复现、可比较的评估流程。

普通用户 vs 专业用户

普通用户专业用户
我觉得这个模型更聪明这个模型在 X 任务上完成率 87%,人工修改量减少 40%
这个工具挺好用的这个工具在 Y 场景下输出采用率 65%,平均耗时 3.2 分钟
这个 prompt 效果不错这个 prompt 在 30 个测试样本上稳定复现率 92%
模型升级后感觉变强了模型升级后 A 类任务提升 12%,B 类任务退化 5%

六步 Eval 框架

  1. 真实任务取样 — 不是随便找几个问题,而是从真实工作流中选代表性任务
  2. 指标定义 — 准确率、完成率、人工修改量、耗时、成本、失败类型
  3. Golden Set 建设 — 为高频任务建立标准答案、评分标准或人工评审规则
  4. 对照实验 — A/B test:模型 vs 模型、prompt vs prompt、workflow vs workflow
  5. 回归测试 — 模型/prompt/工具/workflow 更新后检查是否退化
  6. 失败案例沉淀 — 系统记录失败类型,形成 failure mode 知识库

与 Benchmark 方法论的区别

Benchmark 方法论Eval Harness
回答:我是否知道如何设计评测?回答:我是否真的在工作中持续运行评测?
偏方法论偏实践
一次性设计持续运行

Eval 不是学术专属

日常工作中的 eval:

  • 这个模型写文章,人工修改量减少了吗?
  • 这个 Agent 写代码,测试通过率是多少?
  • 这个 workflow 做调研,事实错误率是多少?
  • 模型更新后,原来的工作流有没有退化?

相关概念

  • AI Native — Eval 是 L1 第九维度
  • Agent Orchestration — 多 Agent 输出的质量需要 eval
  • Practice-first Learning Loop — eval 是判断"是否纳入工具栈"的依据

相关笔记

  • 模型评估体系与方法论
  • Eval实践框架

来源

  • 阿迪亚-2026-AI-Native能力Benchmark — D4 Benchmark 方法论 + D9 Eval 运行能力

互链

链接来自概念卡正文里的双链,编译时能解到本期词条集的才成为站内链接。

反链(4)

出处

路径是本地知识库(Obsidian 库)里的位置,正文与概念卡逐字对应。

  • 概念卡原文Eval Harness(评估框架)03_RESOURCES/概念/eval-harness.md
  • 所属知识地图栏目概念页索引 · Agent 架构与 Harness 治理03_RESOURCES/概念/Index.md
  • 正文引用的知识库笔记模型评估体系与方法论02_AREAS/AI开发/K2-技术方法与实现/优化方法/模型评估体系与方法论.md
  • 正文引用的知识库笔记Eval实践框架02_AREAS/AI开发/Eval实践框架.md
  • 正文引用的知识库笔记阿迪亚-2026-AI-Native能力Benchmark03_RESOURCES/摘录/adiya-2026-AI-Native-benchmark.md

编译入库:2026年10月6日。词条由知识库编译而来, 修正要回到概念卡改,再重新编译。