首发活动:通行卡优惠低至 7 折;新用户注册赠送 30 积分立即体验

2026 年了,AI 给的参考文献,还有多少是编的?——DeepSeek篇

摘要
AI 发展几年了,它给出的参考文献,能直接用了吗?最新一次实测:66 条中仅 16 条「宜引」(占 24%),六组中最高的一组也只有 50%,全部未过半,一半条目连「真实」都不成立。我们以三种问法、两种设置组合成六组,让 DeepSeek 各生成一段知识图谱方向的文献综述,6 组共得参考文献 66 条。判定分两项:真实性对照数据库与刊方记录,题名与第一作者一致记为「真实」;完整性依据 GB/T 7714,必备著录项齐全且与真实记录一致记为「完整」;在「真实」的基础上做到完整记为「宜引」。给得最多的一组最不能用。「随手问+深思」一口气给了 17 条,其中 10 条整条没有作者。(测试日期 2026-09-14)
版本注:本文数据为 2026 年 9 月 14 日于 DeepSeek 网页版中测得,历次测试数据见文末。

一、引言

用 AI 辅助写过论文、查过文献的人,应该都见过输出末尾那列参考文献:题名、作者、年卷期页等,排得整整齐齐,有的每条都附上了来源链接。这些条目具体能查到几条?我们做了一个测试。

AI 给出的参考文献列表,整表粘贴进今日宜引文,逐条核对真实性与著录字段,附可点出处。

二、方法

2.1 测试设置

测试对象:DeepSeek 网页版。2026-09-10 该产品把快速、专家、识图三个模式入口合并为一个统一模式,本次在合并后的统一模式下测试,取第一次输出为测试材料。

变量:三种问法 × 两种设置(默认:智能搜索开、深度思考关;深思:两者全开),每组新开对话、互不共享上下文。模式入口合并后,这两个开关仍在输入框上,所以两次测试的设置轴相同。

三种问法按提问的详略程度设置(prompt 原文如下):

随手问:我毕业论文写知识图谱方向的,要写文献综述,帮我写一段,然后列一下参考文献。
image-20260730140205979
提要求:帮我写一段关于知识图谱构建技术的文献综述,500字左右,语言学术一些,引用10篇文献,文末按GB/T 7714格式附上参考文献列表。
image-20260730140101933
列要点:请围绕知识图谱构建技术写一段500字左右的文献综述。要求:①引用10篇真实存在的期刊论文,正文用[1][2]标注;②文末按GB/T 7714格式列出参考文献;③每条附DOI或原文链接;④不确定真实存在的文献不要引用。
image-20260730140133372

prompt 中不指定 GB/T 7714 的版本号,也不指定顺序编码制或著者-出版年制;AI 默认采用哪一版、哪一制,作为观察项记录。

输出的样子两次相同:正文带角标,文末一列编号条目,回答自带「搜索到 N 个网页」。下图是首测(2026 年 7 月)时的一例。

file-1205f225a02d4251cfb04b05ca4b6ca8

2.2 判定标准

  • 真实:存在唯一真实文献与该条对应,题名与第一作者均与数据库或刊方记录一致。
  • 完整:依据 GB/T 7714(2025版),引用文献的必备著录项都有且与真实记录一致。
  • 宜引:真实且完整的条目。

2.3 核验流程

将 AI 给出的参考文献列表逐条通过我们的应用(今日宜引文)核验,在其基础上人工点开来源链接逐条确认,确保结果的可靠性;66 条中,应用与人工的判定一致 64 条,其余两条逐条复核后以人工判定为准。

file-8e5e355c63715b86051abaeae451712c

三、结果

表 1 六组核验结果(n = 66)
问法默认深思平均宜引率
真实完整真实完整
随手问67%(6/9)22%(2/9)35%(6/17)12%(2/17)16.99%
提要求40%(4/10)20%(2/10)50%(5/10)30%(3/10)25%
列要点40%(4/10)20%(2/10)80%(8/10)50%(5/10)35%
平均48.89%20.74%55.10%30.59%25.66%

注:表中平均为各组比率的算术平均。

总计:66 条中,真实条目共 33 条;宜引条目共 16 条;整条不写责任者的 27 条;作者名单与记录不符的 6 条。66 条全部能对到一篇真实存在的文献。

  1. 没有一组过半,最高的一组 50%(列要点+深思),最低的一组 12%(随手问+深思)。
  2. 给得最多的一组最不能用。「随手问+深思」一口气给了 17 条,是六组里最多的,其中 10 条整条没有作者,宜引只有 2 条。要求越松、输出越长,可用的比例越低。
  3. 在 prompt 里点名「引用真实存在的期刊论文」「不确定真实存在的文献不要引用」并要求附 DOI 的「列要点」问法,两种设置下的宜引率都是同设置里最高的(20%、50%):提问技巧能改善结果,替代不了逐条核对。
  4. 没有完全凭空捏造的条目。66 条基本都能对应到一篇真实存在的文献,但能直接引用的比例并没有因此提高,错法从「给错作者」换成了「不给作者」。

观察项:六组输出的参考文献均为编号条目,即顺序编码制;均未标注 GB/T 7714 的版本号。六组回答都自带「搜索到 N 个网页」,检索是开着的。应用对六组的体例识别均为 GB/T 7714・顺序编码,依 2025 版标准核对。

四、主要错误形态

AI 生成文献的通病是幻觉编造、张冠李戴、细节缺失三类。本次测试的问题主要集中在后两类,具体到字段是这几种:

1. 整条不写责任者: 题名、刊名、卷、期、页码往往都对,唯独没有作者;另一条给足了刊名与期号,作者六人一个没写,这是本次最常见的一种。

2. 真文配错作者: 有写错一个字的,一篇《贵州大学学报(自然科学版)》综述的第一作者「杨观赐」写成「杨观鹏」;有换成另一位真实学者的,一篇《计算机科学与探索》综述署名钱慎一,刊方记录的第一作者是张静;也有整组换人的,一条署名 HOFFER 等的会议论文,真身署的是另一批作者。题名与链接都真,作者名单不真,粗略核查难以发现,人工核验也容易遗漏。

3. 刊名与卷号张冠李戴: 一篇《控制与决策》2025 年 40 卷 12 期的综述,被标成《计算机科学与探索》2025 年 19 卷 12 期,刊名与卷号都换了,页码却仍是真刊的那一段。会议论文则常只写泛称,真身是另一个小规模的会议。

4. DOI 四种情形: 真文真号;条目所给的号解析不出、真文另有其号;把数据库的内部编号当成 DOI 写上去;真文有 DOI 却没附。

5. 文章编号与页码的偏移: 一篇文章编号 217 写成 216;有的条目页码漏了续页等这类小偏移。

基本上各字段都有错配或遗漏的情况。

五、结论

AI 给出的参考文献,即便条条都对应真实文献,也仍然不能直接引用:本次 66 条全都有真身,能直接用的只有 16 条。凭空编造的问题这次没有出现,取而代之的是漏。其中最常见的是整条不写作者,题名刊名卷期页都给了,唯独把该署谁的名字留白。逐条核验之后才能用。

用 AI 起草的文献综述,交稿前把参考文献整表过一遍:今日宜引文逐条比对数据库,有出入的给出修正值,按目标体例导出。
各家 AI 的参考文献真实率横向对照,见AI 参考文献真实率榜,随各篇测评更新。

历次测试

测试日期测试设置条数真实宜引测试对象变化
2026-09-14网页版,统一模式;设置同首测。6633 (50%)16 (24%)产品 09-10 将快速 · 专家 · 识图三个模式入口合并为统一模式并上线新模型
2026-07-29网页版,快速模式;默认(智能搜索开、深度思考关)/ 深思(两者全开)两种设置5930 (51%)18 (31%)首次测试

常见问题

本文为今日宜引文原创。转载请注明出处并附原文链接,不得修改、不得用于商业用途。