AI真的在“进化”自己了:8天自我改写了100次

sourcePaperWeekly·章鱼烧·15:22 编辑
AI真的在“进化”自己了:8天自我改写了100次

来源:PaperWeekly

原标题:模型权重不动,Harness改写100轮:「递归自我改进」首获实证


100 轮改写,约九成候选版本未能通过评测,真正刷新历史最佳的只有 7 轮。

Weco AI 让一个研究 agent 连续运行 8 天,反复重写另一个研究 agent 的 harness。

这里的 harness指承载搜索、上下文管理、错误处理和验证流程的 agent 运行框架。每个候选版本都要在固定成本下完成整套评测,再根据内层 agent 无法看到的隐藏分数决定是否保留。

搜索策略如何调整,哪些历史信息进入上下文,错误怎样处理,评测如何执行,以及怎样防止奖励作弊,都由外层 agent 自动修改。

最终得到的 AIDE₄₇(AI-Driven Exploration)与 AIDE₈₅ 不仅超过起点,而且这些提升还能迁移到未参与版本筛选的外部任务。在机器学习工程、启发式算法和天气模拟三类评测中,两个版本均优于团队人工调试约两年的 AIDE_human。KernelBench 上的奖励作弊比例也从 63% 降至 34%。

整个实验没有更新基础模型权重,变化集中在 harness 代码。

现有自动研究系统已经能围绕具体任务修改代码、运行实验,再根据结果进入下一轮搜索。

AIDE² 在此基础上增加了一层外循环,让研究 agent 直接修改负责执行研究的 agent。

按照 Weco 提出的 RSI 分级,团队将这组结果视为递归自我改进首次达到 Level 1 的实验性证据。关键在于,这些提升经过了多轮筛选,也能迁移到未参与优化的任务。

Harness成为优化对象

AIDE² 把自动研究分成内外两层。

内层 AIDE 负责提出方案、修改代码和运行实验;外层 AIDE_human 则直接修改内层 agent 的 harness,包括搜索策略、上下文管理、错误处理和评测逻辑。

外层 AIDE_human 由 Claude Opus 4.7 驱动,内层各版 AIDE 则运行在 Gemini 3 Flash 上。

Weco 选择这种非对称配置,是因为 Gemini 3 Flash 在固定预算下能匹配或略胜更大的模型,同时成本更低。外层自身的 token 开销只占总成本的一小部分,因此使用了能力更强的模型。

图片候选harness只有在完整评测中超过当前最佳版本,才会被保留。

评测覆盖机器学习工程、启发式算法工程和 harness 工程。具体方案在不可见数据上仍能保持优势,属于一阶泛化。改进后的 harness 还能在从未参与筛选的新任务上生效,才提供二阶泛化证据。

每次评测还设置按美元计量的固定预算。增加模型调用次数、无限扩大 Best-of-N 采样,或者进行激进并行,都不能绕过这项成本约束。

100轮中的7次迭代

AIDE² 连续完成 100 个外层步骤,从 AIDE₀ 迭代到 AIDE₉₉,全程没有人工介入。

刷新历史最佳的改写出现在第 2、6、28、39、47、63 和 85 轮,内部综合分数由 0.703 升至 0.778。

图片

100轮外层改写中,共有7轮刷新历史最佳成绩

团队随后把 AIDE₄₇ 和 AIDE₈₅ 放到三项从未参与版本筛选的外部任务上。

外部结果并没有单调上升。MLE-Bench Lite 上,AIDE₄₇ 最高,达到 0.739。AIDE₈₅ 回落到 0.721,但仍超过 AIDE₀ 的 0.673 和人工版的 0.708。

ALE-Bench Lite 和 WeatherBench 2 则由 AIDE₈₅ 领先,分别达到 1790 和 0.803。更重要的是,AIDE₄₇ 与 AIDE₈₅ 在三项外部任务上都超过了起点和人工版。

图片AIDE₄₇和AIDE₈₅在三项外部任务上均超过AIDE₀和人工版

MLE-Bench Lite 取 3 个随机种子均值,ALE-Bench Lite 覆盖 10 道题,每题运行 10 个随机种子。WeatherBench 2 为每个 agent 限定 15 美元预算。

AIDE₈₅ 在 MLE-Bench Lite 上低于 AIDE₄₇,说明内部综合分数上升,并不代表所有外部能力同步增强。两代版本都在未参与筛选的任务上保持优势,为二阶泛化提供了证据。

搜索与上下文重构

AIDE₀ 先生成 5 个彼此差异较大的初始方案。此后的每一步,要么随机调试存在错误的叶节点,要么选择整棵方案树中的最高分节点继续改进,整体仍以全局贪心为主。

图片

AIDE₀生成5个初始方案后,随机调试bug叶节点或继续改进全局最佳方案

AIDE₈₅ 不再只盯着整棵树中的最高分节点。它把每个初始方案衍生出的子树当作一条独立搜索分支,用多臂老虎机在分支之间分配预算。

选中某条分支后,再沿其中的最佳节点继续改进。如果当前最佳分支长期停滞,系统会复制全局最佳代码,并用新的策略另开一条分支。

图片

AIDE₈₅先在搜索分支之间分配预算,再沿选中分支的最佳节点继续优化

复杂度更高的搜索方案大多没有通过改进门槛。岛屿遗传算法、锦标赛选择和 MCTS 式价值回传等设计,没有取得高于当前版本的隐藏评测分数。

团队在一个随机种子中检查了 95 个被拒方案。考虑到运行间分数波动约为 0.02—0.045,那些只落后 0.004 或 0.007 的方案,最多只能说没有证明优于当前版本,不能直接判为无效。

上下文管理的变化同样重要。AIDE₀ 在生成或改进方案时,会把此前所有尝试的完整代码和执行输出一并放入提示词。

AIDE₈₅ 仍然保存完整方案树,但为不同操作构建不同的最小上下文。方案生成只看基线与简短轨迹,调试聚焦出错节点和日志尾部,方案改进则读取当前最佳版本与停滞信号。

Weco 在正文中称,完整提示词的平均长度被压缩到朴素历史拼接方式的约 1/16,节省下来的 token 用于增加搜索步数。

图片


 AIDE₈₅按操作类型读取不同上下文,避免将完整历史反复塞入提示词

评测可靠性提升

KernelBench 还检验了奖励作弊(Reward Hacking)。团队会把单元测试里测得的加速,放到端到端训练负载中重新验证。

若最终保留下来的加速不足原结果的一半,或者直接变慢、运行失败,就记为一次奖励作弊。

AIDE₈₅ 将奖励作弊比例从 63% 降至 34%,接近减半,也低于 AIDE₄₇ 和人工版的 42%。

图片

Reward Hacking比例由63%降至34%

外层目标没有直接要求系统降低奖励作弊。作者推测,只能操纵公开指标、却无法在隐藏评测中保留优势的方案,更难在长期筛选中存活。

最终版本形成了三类防护机制。各阶段提示词中加入了反过拟合指令。硬编码 Guard 会在发现可疑输出时触发重新生成。系统还尝试用统计校正削弱异常高分的影响,但这一层后来被改坏,实际上没有改变候选排序。

图片

系统自动形成三类防护机制,其中统计层在最终版本中失效

外层 agent 还给评测脚本写入了一个大型补丁。团队起初怀疑它在利用漏洞,检查后发现,这个补丁修复的是单个 traceback 可能导致整套隐藏评测崩溃的问题,对最终分数几乎没有影响。

AIDE₈₅ 的代码逻辑也变得更复杂,还残留无效代码,后续理解、维护和生产部署都更加困难。

递归能力边界

Weco 的四级框架以 Level 0 为起点,系统能够独立跑完整个研发循环,但效率仍低于人工。

AIDE² 被归入 Level 1,因为团队认为,它改进同一系统的效率已经超过人工。Level 2 考察点火(Ignition),自动改进后的内层 agent,能否反过来成为更好的外层优化 agent;Level 3 才对应固定预算下的进展速度开始加快。

图片

按照Weco的RSI分级,AIDE²处于Level 1,尚未通过Level 2点火测试

按团队对投入时间的估算,AIDE² 的研发速度比人工流程高约两个数量级。这项估算没有统一折算模型调用、算力和人工工时,因此不能理解为综合成本降低约 100 倍。

团队把 AIDE₄₇ 放到外层重新运行 50 轮。它大约 20 轮进入平台期,AIDE_human 则用了约 40 轮。两者最终收敛到相近上限,而且效率差异未达到统计显著水平。

这最多说明 AIDE₄₇ 可能更省样本,还不足以证明它已经成为更强的外层优化 agent。

图片

AIDE₄₇更早进入平台期,但渐近性能没有明显优势

Weco 把这项能力称为第三阶泛化。点火只是智能爆炸的必要条件之一,而当前实验尚未提供足够证据。

AIDE² 把自我改进具体到了 harness 层。研究 agent 开始修改承载自身搜索、上下文和验证流程的研发系统,并把少数有效改进积累到后续版本。

100 轮实验呈现的是高淘汰率下的渐进积累,大多数修改没有通过评测,最终代码也更加复杂,还残留无效逻辑。

现阶段能够确认的是,一套受固定成本和隐藏评测约束的自动研发循环已经成立,持续加速尚未出现。

完整技术报告与 AIDE₈₅ 代码尚未发布,实验协议和成本口径仍需进一步披露。以 Weco 的分级为准,AIDE² 已经走到 Level 1,Level 2 点火和 Level 3 加速仍未出现。


Twitter:https://twitter.com/BitpushNewsCN

比推 TG 交流群:https://t.me/BitPushCommunity

比推 TG 订阅: https://t.me/bitpush

原文链接
#AIDE#harness#Weco#上下文重构
说明: Bitpush 所有文章只代表作者观点,不构成投资建议

相关推荐

加载中...