进阶Agent多模态Harness评测

VISTA:何恺明团队给多模态模型造的「视觉 Harness」

让 AI 只靠「看屏幕」玩长程游戏:视觉观察变成可检索的记忆,模型自己决定何时放大看细节。ARC-AGI-3 上拿到满分的是它这套 Harness,不是某个更大的模型。

精选与签发:晓黎学习 · 复核:晓黎学习 · 发布于 2026-10-06。信息基于仓库与官网公开内容,以官方页面为准。

它是什么

VISTA 出自何恺明等人之手(论文 arXiv.02200),是一个面向多模态模型的视觉推理 Harness。一句话说清它解决的问题:让 AI 只靠「看屏幕」去玩那些需要长程交互的游戏时,模型不该每次都从零看起,视觉观察应该变成可以检索的记忆。

它的做法有三块,每一块都是我们课程里讲过的 Harness 工程词汇在视觉域的落地:

  • 无损视觉记忆:看过的每一帧都保留下来,成为可检索的记忆,而不是被上下文窗口挤掉;
  • 模型自主的检查工具:inspect(回看指定帧与区域)、read_pixels(读取区域像素数值)、history(回看历史动作)。什么时候放大看细节,由模型自己决定;
  • 双记忆文件:GUIDE.md 充当持久记忆、WORKING.md 充当工作记忆,用两个文件把「长期经验」和「当前任务状态」分开。

为什么被我们选中

ARC-AGI-3 的 25 个公开游戏上,用 Claude Opus 5.0 跑出了 RHAE 100 分(GPT-5.6 99 分),赢的关键不是模型更大,而是 Harness 更好。这是「Harness 工程」这条内容线最有说服力的公开实证之一:同一个模型,装上不同的脚手架,表现天差地别。

它同时也是一份可以逐行读的参考实现:MIT 协议,代码、Docker 镜像构建方式、批量评测脚本全部公开。

怎么上手(进阶读者)

这一篇的门槛明显高于本站大多数内容,先说清楚再给路径:

  • 环境:Linux x86_64、Python 3.12、Docker Engine;
  • Agent 运行时二选一:Codex CLI(0.145.0)或 Claude Code(2.1.220),经 npm 安装;
  • 安装:建虚拟环境后 pip install -e .,复制 .env.example 为 .env 填入密钥(ARC API key 或 Claude Code 凭证),按所选后端构建 Docker 镜像;
  • 跑第一个示例:vista --profile arc3 --backend claude --game-id s5i5 --operation-mode online。

适合谁

  • 进阶读者:正在做 Agent 评测、视觉推理实验的工程师,它是一个可以直接用的研究框架;
  • 所有读者:即使不跑代码,「无损视觉记忆 + 自主检查工具 + 双记忆文件」这三件事本身就值得读懂,它们回答的是「Agent 的记忆应该怎么设计」这个每个 Agent 产品都要回答的问题。

链接与出处

本文由晓黎学习签发,基于仓库 README 与论文页公开信息整理;跑实验前请以仓库最新文档为准。

VISTA:何恺明团队给多模态模型造的「视觉 Harness」 · 项目精讲 | 晓黎学习