
AI真的在“进化”自己了:8天自我改写了100次
来源:PaperWeekly原标题:模型权重不动,Harness改写100轮:「递归自我改进」首获实证100 轮改写,约九成候选版本未能通过评测,真正刷新历史最佳的只有 7 轮。Weco AI 让一个研究 agent 连续运行 8 天,反复重写另一个研究 agent 的 harness。这里的 harness指承载搜索、上下文管理、错误处理和验证流程的 agent 运行框架。每个候选版本都要在固定成本下完成整套评测,再根据内层 agent 无法看到的隐藏分数决定是否保留。搜索策略如何调整,哪些历史信息进入上下文,错误怎样处理,评测如何执行,以及怎样防止奖励作弊,都由外层 agent 自动修改。最终得到的 AIDE₄₇(AI-Driven Exploration)与 AIDE₈₅ 不仅超过起点,而且这些提升还能迁移到未参与版本筛选的外部任务。在机器学习工程、启发式算法和天气模拟三类评测中,两个版本均优于团队人工调试约两年的 AIDE_human。KernelBench 上的奖励作弊比例也从 63% 降至 34%。整个实验没有更新基础模型权重,变化集中在 harness 代码。现有自动研究系统已经能围绕具体任务修改代码、运行实验,再根据结果进入下一轮搜索。AIDE² 在此基础上增加了一层外循环,让研究 agent 直接修改负责执行研究的 agent。按照 Weco 提出的 RSI 分级,团队将这组结果视为递归自我改进首次达到 Level 1 的实验性证据。关键在于,这些提升经过了多轮筛选,也能迁移到未参与优化的任务。Harness成为优化对象AIDE² 把自动研究分成内外两层。内层 AIDE 负责提出方案、修改代码和运行实验;外层 AIDE_human 则直接修改内层 agent 的 harness,包括搜索策略、上下文管理、错误处理和评测逻辑。外层 AIDE_human 由 Claude Opus 4.7 驱动,内层各版 AIDE 则运行在 Gemini 3 Flash 上。Weco 选择这种非对称配置,是因为 Gemini 3 Flash 在固定预算下能匹配或略胜更大的模型,同时成本更低。外层自身的 token 开销只占总成本的一小部分,因此使用了能力更强的模型。候选harness只有在完整评测中超过当前最佳版本,才会被保留。评测覆盖机器学习工程、启发式算法工程和 harness 工程。具体方案在不可见数据上仍能保持优势,属于一阶泛化。改进后的 harness 还能在从未参与筛选的新任务上生效,才提供二阶泛化证据。每次评测还设置按美元计量的固定预算。增加模型调用次数、无限扩大 Best-of-N 采样,或者进行激进并行,都不能绕过这项成本约束。100轮中的7次迭代AIDE² 连续完成 100 个外层步骤,从 AIDE₀ 迭代到 AIDE₉₉,全程没有人工介入。刷新历史最佳的改写出现在第 2、6、28、39、47、63 和 85 轮,内部综合分数由 0.703 升至 0.778。100轮外层改写中,共有7轮刷新历史最佳成绩团队随后把 AIDE₄₇ 和 AIDE₈₅ 放到三项从未参与版本筛选的外部任务上。外部结果并没有单调上升。MLE-Bench Lite 上,AIDE₄₇ 最高,达到 0.739。AIDE₈₅ 回落到 0.721,但仍超过 AIDE₀ 的 0.673 和人工版的 0.708。ALE-Bench Lite 和 WeatherBench 2 则由 AIDE₈₅ 领先,分别达到 1790 和 0.803。更重要的是,AIDE₄₇ 与 AI...

