

AI 给的参考文献,为什么总有几条查不到?五种常见幻觉形态
AI 给的参考文献查不到,原因不外乎:整条查无此文;题名真实但字段抄错;真作者真期刊配上不存在的文献;DOI 打不开或指向另一篇;几条真文献杂交拼成一条。
毕业论文交稿前,我让 AI 帮着整理过参考文献表。格式工整,作者、年份、期刊一应俱全,看起来没有任何问题。问题恰恰在「看起来」。
有人真的去数了
2023 年,两位研究者让 ChatGPT 就 42 个主题各写一批文献综述,然后把生成的 636 条参考文献逐条查证。结果:GPT-3.5 给出的引文里,55% 是凭空生成的,数据库里查无此文;GPT-4 降到了 18%,但仍然接近五分之一。更值得注意的是另一半数据:在那些真实存在的文献里,GPT-3.5 有 43%、GPT-4 有 24% 带着实质性的著录错误,作者、年份、卷期或页码与收录记录不符[1]。
两年多过去,新模型解决这个问题了吗。2025 年一项基准测试把 ChatGPT、Claude、DeepSeek、Gemini、Grok 等 8 个主流 AI 聊天机器人放在同一套学术文献检索任务上逐一测量,结论就写在论文标题里:有的模型表现更好,但没有任何一个完全准确[2]。换句话说,用哪个模型都一样,参考文献表在交稿前都需要核对。
为什么 AI 会给出查不到的文献
语言模型按概率生成文本,不检索数据库。让它列参考文献,它生成的是「看起来像一条文献」的文字:真实存在的学者名,合理的期刊名,规范的著录格式,组合在一起却可能对应不到任何一篇真实的论文。这类输出通常被称为「幻觉」。这不是某个产品的缺陷,是生成机制本身的特性。模型越流畅,幻觉条目看起来越可信,因为它们本来就是按「可信的样子」生成的。
由此还有一个直接推论:把参考文献列表发回给 AI,让它「自己检查一遍」,是行不通的。 它确认一条引文存在的方式,和它当初生成这条引文的方式完全相同,都是生成一段看起来可信的文字。它可以流畅地向你确认一条查无此文的文献「真实存在」。因此核对必须发生在数据库里,而不是对话框里。
查不到的文献,集中在五种形态
在我做这个网站的过程中,经手核对的真实引文有上千条。幻觉条目反复出现的,是这五种形态:
- 整条查无。 题名在公开学术数据库里检索不到,作者名下也没有相近的论文。
- 题名真实,字段抄错。 论文是真的,题名一搜就有;但这行引文的细节与收录记录对不上:作者列表少了人或换了人,卷期页码整组是另一套数字,甚至挂错了期刊。前面那项研究把这类计为实质性错误,在真实文献里占 24% 到 43%[1]。文献存在,引用却是错的。
- 真作者、真期刊、不存在的文献。 作者和期刊都真实,但该卷该期并没有这篇文章。
- DOI 打不开,或指向另一篇。 DOI 格式正确,解析出来却是无效链接,或者落到一篇不相干的论文上。
- 杂交条目。 题名前半段来自一篇真实文献,后半段来自另一篇;或者真实题名配了别人的作者。
第一种错得明显,可能比较好查。其他几个难就难在:题名一搜就搜得到,快速检查到这里就过去了,而错藏在字段里,肉眼通读基本拦不住。
交稿前,大家是怎么查的
常见的做法,其实就三种。
第一种,把题名一条条粘进学术搜索引擎或图书馆检索框,查到了再打开收录记录,把作者拼写、年份、卷期、页码一项项对过去,有 DOI 的把 DOI 粘进浏览器,确认解析到的是同一篇。这是最可靠的路,代价是时间:一份一百多条的文献列表,这样核实完要以小时计。省时间的话,把整份列表粘贴进今日宜引文,逐条比对数据库,对不上的直接给出记录里的正确值,每条结论附可点开的出处。
第二种,把列表发回给 AI,让它自己检查。但前面说了,这行不通。
第三种,不查,赌学校也不查。
规矩已经落在纸面上
2025 年 1 月 1 日起施行的《中华人民共和国学位法》第三十七条规定,学位论文被认定为存在「代写、剽窃、伪造等学术不端行为」的,经学位评定委员会审议决定,撤销学位证书[3]。校规层面,复旦大学 2024 年 11 月发布了国内高校首个专门规范 AI 工具在本科毕业论文中使用的文件,明确禁止直接使用 AI 生成正文文本,违规按有关规定处理[4]。另有 2026 年的追踪报道显示,新发表论文里带凭空引文的比例三年涨了约十二倍,一些出版机构已经开始在收稿环节筛查参考文献[5]。
格式审查早已是每年的例行公事。真实性的审查跟上,只是时间问题;AI 用得越多,这一天来得越快。
后来
我把这套核对流程做成了一个网站:每条引文逐字段比对,作者、题名、年份、卷期、页码、DOI 等一项项对;对得上的,给出来源链接。对不上的,直接给出记录里的正确值,一键采用;每条结论都附上可以点开的出处,判定过程零 AI 参与。我叫它「今日宜引文」。
交稿前把参考文献过一遍,不用再一条条手查,也不用再被 AI 的「幻觉」糊弄。
常见问题
- AI 给的参考文献为什么查不到?大语言模型按概率生成文本,不检索数据库;它生成的是「看起来像一条文献」的文字,真实学者名、合理刊名、规范格式组合在一起,却可能对应不到任何一篇真实论文。这是 AI 生成机制的特性。
- ChatGPT 生成的参考文献有多少是假的?2023 年对 636 条 ChatGPT 引文的逐条查证:GPT-3.5 有 55% 查无此文,GPT-4 为 18%;真实存在的文献里,分别还有 43% 与 24% 带实质性著录错误。2025 年对 8 个主流模型的基准测试结论:没有任何一个完全准确。
- 让 AI 自己检查一遍参考文献行不行?不行。它确认一条引文存在的方式与生成这条引文的方式相同,都是生成一段看起来可信的文字;核对必须发生在数据库里,不在对话框里。
- AI 生成的参考文献查得到题名,就是真的吗?不一定。常见的是题名真实而字段抄错:作者列表少人或换人、卷期页码是另一套、挂错期刊;还有真作者真期刊配不存在的文献、DOI 指向另一篇、两篇真文献杂交成一条。题名搜得到只过了第一关。
- 论文里用了 AI 编的参考文献会怎样?《学位法》第三十七条:学位论文存在伪造等学术不端行为的,经审议可撤销学位证书。复旦大学 2024 年已禁止在本科毕业论文中直接使用 AI 生成正文;2026 年的追踪报道显示一些出版机构已在收稿环节筛查参考文献。
- 交稿前怎么核对 AI 给的参考文献?把题名逐条粘进学术搜索或图书馆检索,打开收录记录逐项对作者、年份、卷期、页码,有 DOI 的粘进浏览器确认解析到同一篇;一百多条以小时计。整份列表贴进今日宜引文逐条比对,对不上的直接给出记录里的正确值。
(本文参考文献表按 GB/T 7714—2025 著录。)
参考文献
- [1] WALTERS W H,WILDER E I. Fabrication and errors in the bibliographic citations generated by ChatGPT[J]. Scientific Reports,2023,13(1):14045. DOI:10.1038/s41598-023-41032-5.
- [2] CABEZAS-CLAVIJO Á,SIDORENKO-BAUTISTA P. Assessing the performance of 8 AI chatbots in bibliographic reference retrieval:Grok and DeepSeek outperform ChatGPT, but none are fully accurate[PP/OL].(2025-05-23)[2026-07-25]. https://arxiv.org/abs/2505.18059. DOI:10.48550/arXiv.2505.18059.
- [3] 中华人民共和国学位法[Z]. 2024-04-26 通过,2025-01-01 施行,第三十七条.
- [4] 复旦大学关于在本科毕业论文(设计)中使用AI工具的规定(试行)[Z/OL].(2024-11-28)[2026-07-25]. https://news.fudan.edu.cn/2024/1220/c3163a143685/page.htm.
- [5] MONDAL S. AI-generated fake citations are flooding scientific literature across publications, scientists warn[EB/OL].(2026-05-18)[2026-07-25]. https://phys.org/news/2026-05-ai-generated-fake-citations-scientific.html.
本文为今日宜引文原创。转载请注明出处并附原文链接,不得修改、不得用于商业用途。

