人工智能(AI)在自身研究领域已取得长足进展——能够改进现有算法或开发新算法。然而,根据预印本服务器arXiv近日公布的一项研究,AI目前还无法取代其创造者。
The AI Scientist系统最早的应用之一就是研究AI本身。图片来源:La Pico de Gallo
“我认为,目前开放性研究的完全自动化远未到来。”美国普林斯顿大学的计算机科学家、该预印本合著者Sayash Kapoor表示。
由东京Sakana AI公司团队主导的科研小组率先尝试全面自动化科学流程,涵盖从提出想法、撰写论文到自我评估的全过程。该团队于2024年发布了名为“The AI Scientist”的系统,并于今年3月在《自然》发表了改进版本的研究成果。
The AI Scientist的任务是研究机器学习中的陷阱问题。它生成的3篇论文被提交至一个会议研讨会进行同行评审,其中一篇获得了足以被接受的高分。但Kapoor表示,同行评审是评估论文质量的一种不可靠方式,尤其是在AI研究领域。
为了使AI达到比同行评审更高的标准,Kapoor和同事提出了一项名为“影子评估”的新挑战。他们首先挑选了今年提交给神经信息处理系统大会(NeurIPS)的两篇论文,然后让AI工具根据每篇论文中的研究问题开展研究并撰写论文,再请原作者对生成的内容进行仔细审查。其理念在于,相比忙碌的同行评审人,这些作者具备更多专业知识和投入意愿,能够更深入地分析研究成果。
该团队通过在改进版的智能体系统OpenClaw中“利用”大语言模型Claude Opus 4.8构建了其AI系统,并将它嵌入一个更广泛的“框架”之中,该框架包含通用指令及用于检查进展的方法。该系统为模型提供了一系列工具,包括创建子智能体,访问互联网、软件库、用于运行实验的计算机处理器,以及模拟同行评审的软件。对于每篇论文,AI系统拥有6天时间和3000美元的计算额度。遵循第一篇论文的总体研究方向,Kapoor团队要求系统设计一种精确控制聊天机器人个性的方法;针对第二篇论文,则要求系统为某种神经网络设计一个故障检测器。
该系统能够在数天内运行数百次实验,且不会陷入无法解决的错误循环中。它还完成了扎实的文献综述,并取得了一些次要发现。此外,系统能够识别自身提出的错误主张——有时称为“幻觉”。
然而,该AI系统在两项指定任务上基本失败了,最终分别获得原论文作者给出的2/6和1/6的总体评分。它失败的典型方式是,选择少数假设进行探索,但过早地锁定其中一个,并且当该路径行不通时未能充分回溯。此外,后续的自我评估也不够严格,导致系统坚持最初的选择,不断缩小其主张范围,最终几乎无法提出任何有意义的内容。
评分较低的另一个原因是,该系统未能完全遵循指令或理解上下文,也未能很好地呈现其工作成果:它浪费了大量时间和计算资源,生成的论文写作质量差、格式混乱。Kapoor认为,总体而言,该系统仍缺乏研究创造力。
The AI Scientist的共同创建者陆聪目前就职于美国一家初创公司Recursive Superintelligence,他认为这是一项非常有趣的工作,但作者为系统设置的约束条件不足,一些问题“若采用更严格的控制框架,本可轻易解决”。
Kapoor承认自己对AI持怀疑态度,但表示其团队已尽力给予系统公平的评估机会,甚至延长了截止日期。目前,研究人员正在测试更先进的模型,努力改进框架,并收集更多论文进行影子评估。
Kapoor 补充说,尽管AI在特定的狭义任务上取得一定进展,但尚未具备产生原创性洞见的能力,更不用说研究品味了——即首先该选择什么课题来研究。
相关论文信息:https://doi.org/10.48550/arXiv.2607.27191
版权声明:凡本网注明“来源:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请在正文上方注明来源和作者,且不得对内容作实质性改动;微信公众号、头条号等新媒体平台,转载请联系授权。邮箱:shouquan@stimes.cn。