如今,人工智能(AI)初创公司的“豪言壮语”不少,其中一些夸耀它们的技术将彻底改变软件开发、药物研发和科学研究。然而,近日一项公布于预印本平台bioRxiv的研究发现,这些公司中有许多几乎不参与最基本的科学实践——在科学文献中公开记录发现,以便其他研究者能够评估并在此基础上继续研究。
根据这项研究,超一半的AI独角兽企业,即估值超过10亿美元的私营公司,从未在发表科学论文或预印本中扮演过主要角色。总体而言,它们的论文仅占2025年发表的所有AI论文的千分之一。
“对一个据称正在重塑科学且在科学潜力方面领先的领域来说,没有任何科学文献记录是非常矛盾的。”论文作者、美国斯坦福大学的元科学家John Ioannidis说,“不然,怎么判断他们说的是真实的、经过验证的且可复现的?”其他研究人员也表示,发表物的稀缺使得评估AI能源使用和安全性等的社会影响变得更加困难。
Ioannidis长期研究生物技术领域的独角兽企业的科学文献互动情况。2015年,他率先公开审视了血液检测初创公司Theranos缺乏同行评审研究的问题。这家公司后来被证实存在数据欺诈。在AI飞速发展的今天,Ioannidis很好奇AI独角兽企业是否表现出类似的模式。
为了一探究竟,Ioannidis和团队以1998年至2025年间存在过的全部317家AI独角兽公司为研究对象,检索了它们参与发表的论文,包括期刊文章、会议论文、综述和预印本。他们选取了公司研究人员为第一作者或通讯作者的论文——表明该初创公司对研究工作作出了实质性贡献。最终他们汇总的数据集包含了2077篇发表物,其中同行评审论文1389篇、预印本688篇。
分析显示,超半数的AI初创公司未产出过符合标准的论文。科学影响力的集中程度很高,前5%的公司贡献了超90%的总引用量,其中仅OpenAI就占据了数据集中近40%的引用量。而且即便在最多产的公司,大部分产出也只来自那一小群研究者。例如,尽管OpenAI有约4500名员工,但只有8人发表了5篇或更多符合标准的论文。
考虑到该行业的构成方式,一些AI研究人员对上述发现并不感到意外。美国阿肯色大学的AI研究者Nur Ahmed说,在制药行业,已发表的发现可以受到专利保护,但对于AI公司来说,公开披露技术进展往往收益甚微。加拿大阿尔伯塔大学的AI伦理学家Mohamed Abdalla充道,谷歌2017年关于支撑当今大语言模型的基础架构的里程碑式论文,已成为一个经典的警示案例。尽管谷歌为该技术的某些方面申请了专利,但“没人为此向谷歌付费”。
美国AI开源社区与模型托管平台Hugging Face的Avijit Ghosh指出,初创公司的运营时间线也比学术界快得多。在学术界,同行评审可能需要数月甚至数年。因此,许多AI公司倾向于将研究“博客化”,即通过博文和技术报告而非向科学期刊投稿的形式来发布新模型并公开代码或数据集。而Ioannidis等人的研究并未追踪这些产出。
在Ghosh看来,争论的焦点不应集中在是在期刊还是在博客上发表成果。重要的是公司是否公开了足够多的代码、数据集或模型权重,以便他人能够独立验证相关成果并在其工作基础上继续开发。
美国加州大学伯克利分校的计算机科学家Emma Pierson认为,无论是自由发表还是秘而不宣的AI研究,都可能加速那些引发严重社会和安全问题的模型的发展。
相关论文信息:https://doi.org/10.64898/2026.07.15.738744
版权声明:凡本网注明“来源:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请在正文上方注明来源和作者,且不得对内容作实质性改动;微信公众号、头条号等新媒体平台,转载请联系授权。邮箱:shouquan@stimes.cn。