由全球 20 所顶尖高校研究者联合完成、AItonomy Foundation 主导发布的 ScienceIDE 项目,旨在将科研代码、运行环境及科学验收规则组织成可供 AI 执行、验证和学习的任务,让真实科学结果约束 AI 行动,探索科学能否反哺训练下一代 AI。研究发现,在 1769 个有完整记录的缺陷任务中,55.2% 的程序能正常编译运行但科学结果错误,这类「成功」表象下的错误易误导 AI。通用代码 Agent 有低成本试错反馈机制,而科研代码需额外验证科学结果,且缺乏通用检验标准。ScienceIDE 将科研代码库拆分为封装了运行环境、算例和验证流程的「环境」,通过「任务工厂」生成任务并经对照实验筛选有效任务,让 AI 在「执行、犯错与修正」闭环中获取真实反馈,其轨迹可用于监督微调或强化学习。截至 2026 年 9 月 16 日,ScienceIDE 已收录 27 个开源代码库的 64 个环境定义,生成 2812 个涵盖 14 个学科的任务。目前已设计好模型训练接口,但模型是仅记住特定技巧还是掌握通用科研能力,需进一步验证。该项目为 PhAI Labs 的发现基础模型框架提供落地切入点,既为大模型研发提供公共基座,也让科研团队的隐性经验转化为 AI 训练资源,探索科学经验能否持续转化为 AI 学习材料、推动 AI 进化。