本文转自:中国科学报
徐锐

图片来源:ADRIA VOLTA
本报讯如今的人工智能(AI)初创公司不乏豪言壮语,其中一些声称,它们的技术将彻底改变软件开发、药物研发和科学研究。然而,一项近日公布于预印本平台bioRxiv的研究发现,许多此类公司几乎没有参与最基本的科学实践——将研究成果公开发表在科学文献上,以便其他研究人员能够评估并在此基础上继续拓展。
根据这项研究,超过一半的AI独角兽企业,即估值超过10亿美元的私营公司,从未在发表科学论文或预印本方面扮演过主要角色。据统计,在2025年,该领域企业发表的AI论文总数仅占所有AI论文的千分之一。
“对一个被认为正在重塑科学且在科学潜力方面如此领先的领域来说,没有任何科学文献似乎是一个非常奇怪的悖论。”论文作者、美国斯坦福大学的元科学家John Ioannidis说,“不然,怎么判断他们所说的是真实、经过验证且可重复的呢?”其他研究人员则表示,出版物的稀缺也使得评估AI的社会影响,包括能源使用和安全性等变得更加困难。
Ioannidis一直在研究生物技术领域的独角兽企业与科学文献的互动情况。2015年,他曾率先公开质疑血液检测初创公司Theranos缺乏同行评审的研究,这家公司后来被证实存在数据欺诈行为。在AI飞速发展的今天,Ioannidis想知道AI独角兽企业是否也存在类似的模式。
为了找到答案,Ioannidis和团队以1998年至2025年间存在过的全部317家AI独角兽公司为研究对象,检索了与它们相关的出版物,包括期刊文章、会议论文、综述和预印本。团队选取了那些公司研究人员为第一作者或通讯作者的出版物,这意味着初创公司对这项研究工作作出了实质性贡献。最终的汇总数据集包含了2077篇出版物,其中有同行评审论文1389篇、预印本688篇。
分析显示,超过半数的AI初创公司从未发表过任何符合要求的论文。而科学影响力更为集中——前5%的公司贡献了90%以上的总引用量,其中仅OpenAI就占据了数据集中近40%的引用量,而且即便是最多产的公司,大部分成果也来自一小群研究者。例如,尽管OpenAI有约4500名员工,但只有8人发表了5篇或更多符合要求的论文。
考虑到该行业的构成,一些AI研究人员对上述发现并不感到意外。美国阿肯色大学的AI研究者Nur Ahmed说,在制药行业,发表的科研成果可以得到专利保护,但对于AI公司来说,公开披露技术进展往往收益甚微。加拿大阿尔伯塔大学的AI伦理学家Mohamed Abdalla补充道,谷歌2017年关于支撑当今大语言模型基础架构的里程碑式论文,已成为一个经典的警示案例。尽管谷歌为该技术的某些方面申请了专利,但“没有人为此向谷歌付费”。
美国AI开源社区与模型托管平台Hugging Face的Avijit Ghosh指出,初创公司的运营节奏也比学术界快得多。在学术界,同行评审可能需要数月甚至数年。因此,许多AI公司倾向于将研究“博客化”,即通过博文和技术报告而非科学期刊来发布新模型、代码或数据集。而Ioannidis等人的研究并未追踪这些产出。
在Ghosh看来,争论的焦点不应是在期刊还是在博客上发表成果,而在于公司是否发布了足够多的代码、数据集或模型权重,以便他人能够独立验证并在其工作基础上继续开发。
美国加州大学伯克利分校的计算机科学家Emma Pierson则担心,无论是公开发表还是秘而不宣的AI研究,都可能催生那些会引发严重社会和安全问题的模型,包括大幅提升网络攻击的威力。“如果我们在开发治疗癌症的AI方面不断取得进展,我会觉得‘太棒了’。但事实并非如此。”(徐锐)
相关论文信息:
https://doi.org/10.64898/2026.07.15.738744



2026-08-13 09:42:52

一键分享

