它是什么
VISTA 出自何恺明等人之手(论文 arXiv.02200),是一个面向多模态模型的视觉推理 Harness。一句话说清它解决的问题:让 AI 只靠「看屏幕」去玩那些需要长程交互的游戏时,模型不该每次都从零看起,视觉观察应该变成可以检索的记忆。
它的做法有三块,每一块都是我们课程里讲过的 Harness 工程词汇在视觉域的落地:
- 无损视觉记忆:看过的每一帧都保留下来,成为可检索的记忆,而不是被上下文窗口挤掉;
- 模型自主的检查工具:inspect(回看指定帧与区域)、read_pixels(读取区域像素数值)、history(回看历史动作)。什么时候放大看细节,由模型自己决定;
- 双记忆文件:GUIDE.md 充当持久记忆、WORKING.md 充当工作记忆,用两个文件把「长期经验」和「当前任务状态」分开。
为什么被我们选中
ARC-AGI-3 的 25 个公开游戏上,用 Claude Opus 5.0 跑出了 RHAE 100 分(GPT-5.6 99 分),赢的关键不是模型更大,而是 Harness 更好。这是「Harness 工程」这条内容线最有说服力的公开实证之一:同一个模型,装上不同的脚手架,表现天差地别。
它同时也是一份可以逐行读的参考实现:MIT 协议,代码、Docker 镜像构建方式、批量评测脚本全部公开。
怎么上手(进阶读者)
这一篇的门槛明显高于本站大多数内容,先说清楚再给路径:
- 环境:Linux x86_64、Python 3.12、Docker Engine;
- Agent 运行时二选一:Codex CLI(0.145.0)或 Claude Code(2.1.220),经 npm 安装;
- 安装:建虚拟环境后 pip install -e .,复制 .env.example 为 .env 填入密钥(ARC API key 或 Claude Code 凭证),按所选后端构建 Docker 镜像;
- 跑第一个示例:vista --profile arc3 --backend claude --game-id s5i5 --operation-mode online。
适合谁
- 进阶读者:正在做 Agent 评测、视觉推理实验的工程师,它是一个可以直接用的研究框架;
- 所有读者:即使不跑代码,「无损视觉记忆 + 自主检查工具 + 双记忆文件」这三件事本身就值得读懂,它们回答的是「Agent 的记忆应该怎么设计」这个每个 Agent 产品都要回答的问题。
链接与出处
- 开源仓库(MIT):github.com/joshhhhhan/VISTA
- 论文:arXiv.02200
- 项目主页:vista-research.github.io
本文由晓黎学习签发,基于仓库 README 与论文页公开信息整理;跑实验前请以仓库最新文档为准。