AI-Scientist-v2自主研究
Sakana 的 AI Scientist v2 (Yamada 等人, arXiv:2504.08066) 运行完整研究循环:假设、代码、实验、图表、论文、提交。它是第一个有生成论文通过 ICLR 2025 workshop 同行评审的系统。独立评估 (Beel 等人) 发现 42% 的实验...
AI Scientist v2 — Workshop 级自主研究
Sakana 的 AI Scientist v2 (Yamada 等人, arXiv:2504.08066) 运行完整研究循环:假设、代码、实验、图表、论文、提交。它是第一个有生成论文通过 ICLR 2025 workshop 同行评审的系统。独立评估 (Beel 等人) 发现 42% 的实验因编码错误失败,文献综述经常将已建立的概念错误标记为新颖。Sakana 自己的文档警告该代码库执行 LLM 编写的代码并推荐 Docker 隔离。这两半画面都是重点。
类型: 学习 语言: Python (stdlib, 研究循环状态机玩具) 前置条件: Phase 15 · 03 (AlphaEvolve), Phase 15 · 04 (DGM) 时间: ~60 分钟
问题
研究是一个开放式任务。与 AlphaEvolve 的算法搜索或 DGM 的基准约束自修改不同,研究结果没有机器可检查的正确性标准。论文由审稿人评判,不是单元测试。这使得循环更难闭合——如果闭合则更有价值,因为研究是复利进步所在。
AI Scientist v1 (Sakana, 2024) 通过从人工编写模板开始闭合了循环。LLM 在固定脚手架内填充实验。AI Scientist v2 (Yamada 等人, 2025) 通过使用带视觉语言模型批评循环的 Agent 树搜索移除了模板要求。系统生成想法、实现实验、制作图表、撰写论文,并在审稿人反馈上迭代。
同行评审结论:一篇 v2 生成的论文被 ICLR 2025 workshop 接受(附披露)。独立评估结论:系统远不可靠。两者都是真实的。
概念
架构
- 想法生成。 LLM 基于主题和先前文献提出研究想法。v1 使用模板;v2 使用假设空间上的 Agent 搜索。
- 新颖性检查。 文献检索步骤检查想法是否已发表。这是 Beel 等人评估发现错误标记的步骤——已建立的方法经常被分类为新颖。
- 实验计划。 Agent 起草实验协议并编写代码。
- 执行。 代码在沙箱中运行。失败被反馈到重试循环。在 Beel 等人的测量中,42% 的实验在此阶段因编码错误失败。
- 图表生成。 视觉语言模型读取生成的图表并重写以提高清晰度。这是 v2 的关键技术添加。
- 论文撰写。 LLM 起草论文,与内部审稿人迭代。
- 可选:提交。 论文提交到会议。
Workshop 接受结果意味着什么
一篇 v2 生成的论文通过了 ICLR 2025 workshop 的同行评审。作者向程序委员会披露了论文来源。接受是一个数据点;它不是声称系统”做研究”的许可。
重要背景:workshop 论文是比主会议论文更低的门槛。同行评审有噪声;任何给定日都有小部分提交被接受。一次成功是概念验证,不是可靠性声明。
独立评估发现了什么
Beel 等人 (arXiv:2502.14297) 运行了外部评估。头条发现:
- 实验失败。 42% 的实验因编码错误失败(错误导入、形状不匹配、未定义变量)。重试循环捕获了一些,不是全部。
- 新颖性错误标记。 文献检索步骤经常将已建立的概念标记为新颖。这是研究等价的幻觉。
- 呈现质量差距。 视觉语言图表批评产生了出版级视觉效果,掩盖了底层实验弱点。
最后一个发现对本阶段最重要。产生令人信服输出但不做令人信服研究的系统比明显失败的系统更危险,不是更安全。评估必须触及底层声明,不停留在图表上。
沙箱逃逸关注
Sakana 自己的仓库 README 警告:
由于此软件执行 LLM 生成的代码,我们无法保证安全性。存在危险包、不受控网络访问和生成意外进程的风险。使用风险自负,考虑 Docker 隔离。
这是未验证领域自主性的操作形态。LLM 编写代码;代码运行;代码可以做进程被允许的任何事。没有硬限制文件系统、网络和进程操作的沙箱,任何自主研究 Agent 都可以泄露数据、消耗计算或重写自身。
AlphaEvolve 的沙箱故事更容易,因为其评估器严格。AI Scientist v2 的循环以开放式目标运行开放式代码。这就是它需要更强隔离(最低 Docker;推荐 seccomp / gVisor)和每个提交离开系统前人工审查的原因。
v2 在前沿栈中的位置
| 系统 | 目标 | 输出类型 | 评估器 | 已知失败 |
|---|---|---|---|---|
| AlphaEvolve | 算法 | 代码 | 单元 + 基准 | 受评估器严谨性约束 |
| DGM | Agent 脚手架 | 代码 | SWE-bench | 奖励黑客 |
| AI Scientist v2 | 研究论文 | 文本 + 代码 + 图表 | 同行评审(弱) | 实验失败、错误标记、光鲜掩盖弱点 |
v2 在三者中自动评估器最弱、输出面最宽、到达公共制品的路径最短。操作控制(沙箱、审查、披露)做了大部分安全工作。
构建它
code/main.py 将 v2 循环模拟为状态机:想法 → 新颖性检查 → 实验 → 图表 → 论文 → 审查 → 接受或迭代。每个状态有从 Beel 等人发现中提取的可配置失败概率。运行模拟器 N 次循环并计数:
- 多少想法到达提交。
- 多少提交会有光鲜论文掩盖的关键实验缺陷。
- 重试预算如何权衡质量 vs 产出。
使用它
outputs/skill-ai-scientist-sandbox-review.md 是研究循环 Agent 产生任何东西离开沙箱前的双门审查检查清单。
练习
-
运行
code/main.py使用默认参数。多少循环运行产生”干净”论文?多少产生有实验失败缺陷但被图表批评掩盖的论文? -
默认已使用 Beel 等人的 42% / 25%。用
--experiment-failure 0.20 --novelty-mislabel 0.10重新运行,然后用--experiment-failure 0.60 --novelty-mislabel 0.40。光鲜但有缺陷的份额在两次运行间如何变化? -
阅读 Sakana 的 AI Scientist v2 仓库 README 关于沙箱要求。命名你会为多天自主运行应用的两个额外限制(超越 Docker)。
-
阅读 Beel 等人第 4 节关于呈现质量差距。设计一个额外评估器来捕获看起来光鲜但实验有缺陷的论文。
-
提出一个比”博士读每篇论文”更好扩展的研究 Agent 输出人工审查协议。识别瓶颈并围绕它设计。
关键术语
| 术语 | 人们怎么说 | 实际含义 |
|---|---|---|
| AI Scientist v1 | ”Sakana 的模板化研究 Agent” | 在固定脚手架中填充实验 |
| AI Scientist v2 | ”无模板研究 Agent” | 带 VLM 图表批评的 Agent 树搜索 |
| Agent 树搜索 | ”分支研究 Agent” | 并行展开多个实验计划;按内部批评者修剪 |
| 视觉语言批评 | ”VLM 图表润色” | 多模态模型读取图表并重写以提高清晰度 |
| 文献检索 | ”新颖性检查” | 搜索先前工作以确认想法新颖——记录会错误标记 |
| 光鲜掩盖 | ”漂亮论文,破碎研究” | 呈现质量超过实验质量;隐藏弱点 |
| 沙箱逃逸 | ”LLM 代码突破限制” | Agent 执行的代码做了循环设计者不打算做的事 |
延伸阅读
- Yamada et al. (2025). The AI Scientist-v2 — 论文
- Sakana blog on the Nature 2026 publication — 厂商摘要附同行评审背景
- Beel et al. (2025). Independent evaluation of The AI Scientist — 外部评估数字
- Sakana AI Scientist v1 paper — 模板化前身
- Anthropic — Measuring AI agent autonomy — 开放式研究 Agent 的更广框架