AI深度介入科研审查 顶刊论文错漏与复现难题集中暴露

财π新闻 截至2026年8月,AI工具在学术界的应用场景已经从最初的辅助写作环节,逐步延伸覆盖至大规模文献审查、实验复现核验等核心科研流程,这一技术普及过程中,一系列涉及学术诚信与研究可靠性的深层问题也随之集中暴露,形成了当前全球学术体系必须直面的全新挑战。此前AI工具进入科研领域时,多数研究者仅将其视为提升写作效率、梳理文献脉络的辅助手段,并未预料到其应用边界会快速拓展至学术成果核验的核心环节,而随着使用范围的不断扩大,原本隐藏在海量学术成果中的各类疏漏、不规范操作乃至违规行为,开始被批量识别出来,整个学术生态的运行逻辑也随之迎来新的变量。

当前,论文未按要求披露AI使用情况的现象已经呈现出泛滥态势,大量已发表的顶级期刊论文被监测到存在明确的AI生成痕迹,相关记录显示这类存在AI生成痕迹的顶刊论文数量已经超过700篇。这类论文的普遍特征是行文带有典型的机器生成话术,整体表述模板化痕迹明显,但作者在投稿和发表的全流程中,完全没有按照学术规范对AI工具的使用情况进行任何披露。当这类问题被相关渠道揭露之后,绝大多数涉事作者没有选择公开说明情况、主动接受学术共同体的监督,而是采取悄悄删除相关内容的方式进行私下修正,试图在不引发关注的前提下掩盖问题,更有部分论文因为AI生成的内容存在严重的真实性缺陷,直接暴露了未合规使用AI的事实,最终被期刊执行撤稿处理。在学术成果产出速度不断加快、论文数量呈现爆炸式增长的背景下,传统的同行评审机制已经很难对每一篇投稿的全部实验细节进行逐一核验,大量存在明显缺陷的研究成果因此绕过审核环节,正式进入公共学术体系,成为后续研究者引用和参考的对象,为整个学术知识链条埋下了可靠性隐患。

借助AI Agent开展的自动化审查工作,进一步揭示了顶级学术会议论文复现率极低的突出问题。在2026年国际机器学习大会(ICML)的专项审查工作中,相关人员筛选出92篇具备可验证结论的论文开展复现核验,最终统计结果显示,仅有34篇论文能够复现超过四成的结论,而能够成功复现八成以上结论的论文数量仅为8篇,整体复现水平远低于学术共同体此前的普遍预期。进一步梳理复现失败的具体原因可以发现,这类问题的成因分布十分广泛,既包括论文公开的代码文件缺失、代码运行所需的依赖环境出现断裂无法正常搭建、复现得出的结果与论文标注的结果完全不符,甚至出现相关实验所用的模型已经下线无法获取的情况,也有部分论文存在更为离谱的错误,比如实际对外开源的参数与论文中重点宣传的核心性能卖点严重不符,公开的代码中直接缺失实现核心功能的关键模型模块,这类低级错误的存在,直接导致相关研究的核心结论完全失去了可验证的基础。

基于大模型搭建的论文检测系统,在对大量已发表的顶级会议论文开展系统性扫描后,发现这类经过同行评审流程的成果普遍错漏百出。针对已发表论文的专项检测结果显示,99.2%的受检论文至少存在一处可被识别的客观问题,平均每篇论文存在的客观错误数量达到4.7个,其中数学推导与公式表述类的错误占比最高,达到全部错误类型的54%。从时间维度的统计数据来看,学术论文的错误数量整体呈现出持续上升的趋势,以神经信息处理系统大会(NeurIPS)的论文为例,该会议收录论文的篇均错误数已经从2021年的3.8个,上升至2025年的5.9个,其中约三成的NeurIPS论文包含会直接影响研究结果解读的实质性错误,这类错误并非排版疏漏等无关紧要的小问题,而是会直接改变相关研究核心结论的指向,后续研究者如果直接基于这类成果开展后续探索,很可能会走入完全错误的研究路径,浪费大量的科研时间与资源。

当前AI工具具备的大规模文献核查能力,正在逐步动摇部分长期存在的学术共识。研究人员借助AI工具对跨度极大的历史文献开展回溯核验的过程中,发现了约一个世纪前就被学界公认为权威的化学数据存在明确错误,这些数据在过去数十年甚至上百年的时间里,被不同领域的研究者反复引用,相关错误也沿着文献引用链持续向下传递,经过多轮传播之后,这些原本存在偏差的数据已经在学界形成了被广泛认可的事实共识,几乎没有研究者会对其最初的准确性提出质疑。在AI技术普及之前,现代科学文献的整体规模已经远远超出了任何个体研究者的阅读极限,想要对跨度数十年、涉及数万篇文献的特定领域数据开展系统性复核,几乎是人力不可能完成的任务,这也导致这类已经形成共识的历史错误长期没有机会被发现,而AI技术的应用,让这种覆盖全领域的系统性复核工作首次具备了落地实现的可能性,原本被视为不可撼动的部分传统学术共识,也因此迎来了重新接受核验的契机。

需要明确的是,当前AI核查工具的应用仍然受到检测精确率不足的限制,尚不能完全替代人工审核的角色,无法直接成为学术成果判定的“判官”。以GPT-5驱动的专业论文检测系统为例,其公开的检测精确率为83.2%,在实际运行过程中,每次检测仍有约四成的真实错误未能被系统成功检出,所有AI系统输出的核查结果,仍然必须经过后续的人工审核环节确认,才能最终判定相关内容是否真的存在问题。这种技术现状,也为刚进入学术领域的新人提供了一个全新的研究方向,即借助AI工具的低成本核查能力,对过往的海量旧文献开展系统性核验,针对发现的错误撰写对应的勘误内容,在完善学术知识体系的同时完成自身的学术训练。从当前的发展趋势来看,未来一篇学术论文的正式发表,将不再是相关研究工作的最终终点,而是该成果进入下一轮AI辅助验证流程的全新起点,整个学术体系的自我修正机制,也将随着AI工具的深度参与,迎来全新的运行形态。

(编辑:胡中华)

快讯