AI 给的参考文献,为什么总有几条查不到?
毕业论文交稿前,我让 AI 帮着整理过参考文献表。格式工整,作者、年份、期刊一应俱全,看起来没有任何问题。
问题恰恰在「看起来」。
有人真的去数了
2023 年,两位研究者让 ChatGPT 就 42 个主题各写一批文献综述,然后把生成的 636 条参考文献逐条查证。结果:GPT-3.5 给出的引文里,55% 是凭空生成的,数据库里查无此文;GPT-4 降到了 18%,但仍然接近五分之一。更值得注意的是另一半数据:在那些真实存在的文献里,GPT-3.5 有 43%、GPT-4 有 24% 带着实质性的著录错误,作者、年份、卷期或页码与收录记录不符[1]。
两年多过去,新模型解决这个问题了吗。2025 年一项基准测试把 ChatGPT、Claude、DeepSeek、Gemini、Grok 等 8 个主流 AI 聊天机器人放在同一套学术文献检索任务上逐一测量,结论就写在论文标题里:有的模型表现更好,但没有任何一个完全准确[2]。换句话说,用哪个模型都一样,参考文献表在交稿前都需要核对。
为什么 AI 会给出查不到的文献
语言模型按概率生成文本,不检索数据库。让它列参考文献,它生成的是「看起来像一条文献」的文字:真实存在的学者名,合理的期刊名,规范的著录格式,组合在一起却可能对应不到任何一篇真实的论文。这类输出通常被称为「幻觉」。这不是某个产品的缺陷,是生成机制本身的特性。模型越流畅,幻觉条目看起来越可信,因为它们本来就是按「可信的样子」生成的。
由此还有一个直接推论:把参考文献列表发回给 AI,让它「自己检查一遍」,是行不通的。 它确认一条引文存在的方式,和它当初生成这条引文的方式完全相同,都是生成一段看起来可信的文字。它可以流畅地向你确认一条查无此文的文献「真实存在」。因此核对必须发生在数据库里,而不是对话框里。
查不到的文献,集中在五种形态
在我做这个网站的过程中,经手核对的真实引文有上千条。幻觉条目反复出现的,是这五种形态:
- 整条查无。 题名在公开学术数据库里检索不到,作者名下也没有相近的论文。
- 题名真实,字段抄错。 论文是真的,题名一搜就有;但这行引文的细节与收录记录对不上:作者列表少了人或换了人,卷期页码整组是另一套数字,甚至挂错了期刊。前面那项研究把这类计为实质性错误,在真实文献里占 24% 到 43%[1]。文献存在,引用却是错的。
- 真作者、真期刊、不存在的文献。 作者和期刊都真实,但该卷该期并没有这篇文章。
- DOI 打不开,或指向另一篇。 DOI 格式正确,解析出来却是无效链接,或者落到一篇不相干的论文上。
- 杂交条目。 题名前半段来自一篇真实文献,后半段来自另一篇;或者真实题名配了别人的作者。
第一种错得明显,可能比较好查。其他几个难就难在:题名一搜就搜得到,快速检查到这里就过去了,而错藏在字段里,肉眼通读基本拦不住。
交稿前,大家是怎么查的
常见的做法,其实就三种。
第一种,把题名一条条粘进学术搜索引擎或图书馆检索框,查到了再打开收录记录,把作者拼写、年份、卷期、页码一项项对过去,有 DOI 的把 DOI 粘进浏览器,确认解析到的是同一篇。这是最可靠的路,代价是时间:一份一百多条的文献列表,这样核实完要以小时计。
第二种,把列表发回给 AI,让它自己检查。但前面说了,这行不通。
第三种,不查,赌学校也不查。
规矩已经落在纸面上
2025 年 1 月 1 日起施行的《中华人民共和国学位法》第三十七条规定,学位论文被认定为存在「代写、剽窃、伪造等学术不端行为」的,经学位评定委员会审议决定,撤销学位证书[3]。校规层面,复旦大学 2024 年 11 月发布了国内高校首个专门规范 AI 工具在本科毕业论文中使用的文件,明确禁止直接使用 AI 生成正文文本,违规按有关规定处理[4]。另有 2026 年的追踪报道显示,新发表论文里带凭空引文的比例三年涨了约十二倍,一些出版机构已经开始在收稿环节筛查参考文献[5]。
格式审查早已是每年的例行公事。真实性的审查跟上,只是时间问题;AI 用得越多,这一天来得越快。
后来
我把这套核对流程做成了一个网站:每条引文逐字段比对,作者、题名、年份、卷期、页码、DOI 等一项项对;对得上的,给出来源链接。对不上的,直接给出记录里的正确值,一键采用;每条结论都附上可以点开的出处,判定过程零 AI 参与。我叫它「今日宜引文」。
交稿前把参考文献过一遍,不用再一条条手查,也不用再被 AI 的「幻觉」糊弄。
(本文参考文献表按 GB/T 7714—2025 著录。)
参考文献
- [1] WALTERS W H,WILDER E I. Fabrication and errors in the bibliographic citations generated by ChatGPT[J]. Scientific Reports,2023,13(1):14045. DOI:10.1038/s41598-023-41032-5.
- [2] CABEZAS-CLAVIJO Á,SIDORENKO-BAUTISTA P. Assessing the performance of 8 AI chatbots in bibliographic reference retrieval:Grok and DeepSeek outperform ChatGPT, but none are fully accurate[PP/OL].(2025-05-23)[2026-07-25]. https://arxiv.org/abs/2505.18059. DOI:10.48550/arXiv.2505.18059.
- [3] 中华人民共和国学位法[Z]. 2024-04-26 通过,2025-01-01 施行,第三十七条.
- [4] 复旦大学关于在本科毕业论文(设计)中使用AI工具的规定(试行)[Z/OL].(2024-11-28)[2026-07-25]. https://news.fudan.edu.cn/2024/1220/c3163a143685/page.htm.
- [5] MONDAL S. AI-generated fake citations are flooding scientific literature across publications, scientists warn[EB/OL].(2026-05-18)[2026-07-25]. https://phys.org/news/2026-05-ai-generated-fake-citations-scientific.html.