📌 项目地址SakanaAI/AI-Scientist | ⭐ 13,816 颗星 | 🔧 Jupyter Notebook | 📜 NOASSERTION

项目概况

📌 项目地址SakanaAI/AI-Scientist | ⭐ 13,816 | Jupyter Notebook

Sakana AI(东京的一家 AI 公司)放出了他们所说的“第一个完全自动开放式科学发现系统”。论文、博客、全部运行数据都公开在 Google Drive,每个基座模型在每个模板上大约跑了 50 个想法。README 还附了 10 篇系统自动生成的论文。

这个系统做什么

流程是完整的:LLM 自己提研究想法、写实验代码、跑实验、分析结果,最后用 LaTeX 排版出一篇论文,全程无人工干预。README 的原话是”perform research independently”。

对比现状:现有的前沿模型要么帮人头脑风暴,要么帮人写代码,都需要大量人工监督,或者被限定在单一任务里。这个项目想做到的是整条链路自动化。

我读了那 10 篇论文

README 建议读者自己去读 Claude 生成的论文,”get a sense of the system’s strengths and weaknesses”。我照做了。

选题集中在两块。低维扩散模型改进:DualScale Diffusion、Multi-scale Grid Noise、GAN-Enhanced Diffusion、DualDiff、StyleFusion。Grokking 现象:权重初始化、分层学习率、最小描述长度(MDL)、数据增强,四篇。剩下一篇用 Q-Learning 调 Transformer 学习率。

格式上挑不出毛病。摘要、引言、方法、实验、结论,一应俱全。单读一篇,像一篇正经 workshop 论文。

十篇放一起读,问题就出来了。

问题一:模式单一

每篇都是同一个模板:拿一个基线方法,换掉其中一个组件,跑对比实验,报告指标变化。十篇无一例外。这是组合式探索,不是开放式发现。所谓”open-ended”,至少从这批产出看,开不了多远。

问题二:只报告,不检验

Q-Learning 调学习率那篇:Q-Learning 自身的学习率、折扣因子、奖励设计都会影响结果,论文没做敏感性分析,也没和 Adam 偏置校正这类成熟机制对比。你知道“这样调变好了”,不知道为什么,也不知道边界在哪。

Grokking 与 MDL 那篇更典型。泛化发生时 MDL 同步下降——这个相关性已有文献报告过。系统观察到相关就停笔了,没有干预实验,没有因果验证。

十篇里没有一篇构造反事实检验,没有一篇尝试推翻自己的结论。描述现象,不检验机制。

官方态度值得肯定

README 用了 highly 这个斜体强调:“强烈建议读几篇 Claude 论文,自己判断系统的强弱”。失败的 run 也全部公开在 Drive 里。看原始日志比看论文更能了解系统真实水平。这种不遮掩的做法,比大多数 AI 公司体面。

我的判断

把它当一个模板框架内的批量实验执行器:模板划定问题域和指标,系统做变体组合探索,输出格式统一的报告,全程有日志可审计。需要反复跑实验、反复写报告的团队,能省下机械劳动。

它做不了的:判断一个问题值不值得研究,设计对照实验区分竞争性解释,对反常结果追问到底。

一句话结论:当实验执行器用,别当合作者用。产出当实验报告读,合格;当科学发现读,会失望。科研的瓶颈从来不在写论文那一步,在提出问题那一步——这条流水线再快也绕不开。

想深入了解,先读 README 里的配套论文和博客,再翻 Drive 里的原始日志,尤其是失败的那些。

这篇文章对你有帮助吗?

发表回复