

2026 年了,AI 给的参考文献,还有多少是编的?——DeepSeek篇
版本注:本文数据为 2026 年 9 月 14 日于 DeepSeek 网页版中测得,历次测试数据见文末。
一、引言
用 AI 辅助写过论文、查过文献的人,应该都见过输出末尾那列参考文献:题名、作者、年卷期页等,排得整整齐齐,有的每条都附上了来源链接。这些条目具体能查到几条?我们做了一个测试。
AI 给出的参考文献列表,整表粘贴进今日宜引文,逐条核对真实性与著录字段,附可点出处。
二、方法
2.1 测试设置
测试对象:DeepSeek 网页版。2026-09-10 该产品把快速、专家、识图三个模式入口合并为一个统一模式,本次在合并后的统一模式下测试,取第一次输出为测试材料。
变量:三种问法 × 两种设置(默认:智能搜索开、深度思考关;深思:两者全开),每组新开对话、互不共享上下文。模式入口合并后,这两个开关仍在输入框上,所以两次测试的设置轴相同。
三种问法按提问的详略程度设置(prompt 原文如下):



prompt 中不指定 GB/T 7714 的版本号,也不指定顺序编码制或著者-出版年制;AI 默认采用哪一版、哪一制,作为观察项记录。
输出的样子两次相同:正文带角标,文末一列编号条目,回答自带「搜索到 N 个网页」。下图是首测(2026 年 7 月)时的一例。

2.2 判定标准
- 真实:存在唯一真实文献与该条对应,题名与第一作者均与数据库或刊方记录一致。
- 完整:依据 GB/T 7714(2025版),引用文献的必备著录项都有且与真实记录一致。
- 宜引:真实且完整的条目。
2.3 核验流程
将 AI 给出的参考文献列表逐条通过我们的应用(今日宜引文)核验,在其基础上人工点开来源链接逐条确认,确保结果的可靠性;66 条中,应用与人工的判定一致 64 条,其余两条逐条复核后以人工判定为准。

三、结果
| 问法 | 默认 | 深思 | 平均宜引率 | ||
|---|---|---|---|---|---|
| 真实 | 完整 | 真实 | 完整 | ||
| 随手问 | 67%(6/9) | 22%(2/9) | 35%(6/17) | 12%(2/17) | 16.99% |
| 提要求 | 40%(4/10) | 20%(2/10) | 50%(5/10) | 30%(3/10) | 25% |
| 列要点 | 40%(4/10) | 20%(2/10) | 80%(8/10) | 50%(5/10) | 35% |
| 平均 | 48.89% | 20.74% | 55.10% | 30.59% | 25.66% |
注:表中平均为各组比率的算术平均。
总计:66 条中,真实条目共 33 条;宜引条目共 16 条;整条不写责任者的 27 条;作者名单与记录不符的 6 条。66 条全部能对到一篇真实存在的文献。
- 没有一组过半,最高的一组 50%(列要点+深思),最低的一组 12%(随手问+深思)。
- 给得最多的一组最不能用。「随手问+深思」一口气给了 17 条,是六组里最多的,其中 10 条整条没有作者,宜引只有 2 条。要求越松、输出越长,可用的比例越低。
- 在 prompt 里点名「引用真实存在的期刊论文」「不确定真实存在的文献不要引用」并要求附 DOI 的「列要点」问法,两种设置下的宜引率都是同设置里最高的(20%、50%):提问技巧能改善结果,替代不了逐条核对。
- 没有完全凭空捏造的条目。66 条基本都能对应到一篇真实存在的文献,但能直接引用的比例并没有因此提高,错法从「给错作者」换成了「不给作者」。
观察项:六组输出的参考文献均为编号条目,即顺序编码制;均未标注 GB/T 7714 的版本号。六组回答都自带「搜索到 N 个网页」,检索是开着的。应用对六组的体例识别均为 GB/T 7714・顺序编码,依 2025 版标准核对。
四、主要错误形态
AI 生成文献的通病是幻觉编造、张冠李戴、细节缺失三类。本次测试的问题主要集中在后两类,具体到字段是这几种:
1. 整条不写责任者: 题名、刊名、卷、期、页码往往都对,唯独没有作者;另一条给足了刊名与期号,作者六人一个没写,这是本次最常见的一种。
2. 真文配错作者: 有写错一个字的,一篇《贵州大学学报(自然科学版)》综述的第一作者「杨观赐」写成「杨观鹏」;有换成另一位真实学者的,一篇《计算机科学与探索》综述署名钱慎一,刊方记录的第一作者是张静;也有整组换人的,一条署名 HOFFER 等的会议论文,真身署的是另一批作者。题名与链接都真,作者名单不真,粗略核查难以发现,人工核验也容易遗漏。
3. 刊名与卷号张冠李戴: 一篇《控制与决策》2025 年 40 卷 12 期的综述,被标成《计算机科学与探索》2025 年 19 卷 12 期,刊名与卷号都换了,页码却仍是真刊的那一段。会议论文则常只写泛称,真身是另一个小规模的会议。
4. DOI 四种情形: 真文真号;条目所给的号解析不出、真文另有其号;把数据库的内部编号当成 DOI 写上去;真文有 DOI 却没附。
5. 文章编号与页码的偏移: 一篇文章编号 217 写成 216;有的条目页码漏了续页等这类小偏移。
基本上各字段都有错配或遗漏的情况。
五、结论
AI 给出的参考文献,即便条条都对应真实文献,也仍然不能直接引用:本次 66 条全都有真身,能直接用的只有 16 条。凭空编造的问题这次没有出现,取而代之的是漏。其中最常见的是整条不写作者,题名刊名卷期页都给了,唯独把该署谁的名字留白。逐条核验之后才能用。
用 AI 起草的文献综述,交稿前把参考文献整表过一遍:今日宜引文逐条比对数据库,有出入的给出修正值,按目标体例导出。
各家 AI 的参考文献真实率横向对照,见AI 参考文献真实率榜,随各篇测评更新。
历次测试
| 测试日期 | 测试设置 | 条数 | 真实 | 宜引 | 测试对象变化 |
|---|---|---|---|---|---|
| 2026-09-14 | 网页版,统一模式;设置同首测。 | 66 | 33 (50%) | 16 (24%) | 产品 09-10 将快速 · 专家 · 识图三个模式入口合并为统一模式并上线新模型 |
| 2026-07-29 | 网页版,快速模式;默认(智能搜索开、深度思考关)/ 深思(两者全开)两种设置 | 59 | 30 (51%) | 18 (31%) | 首次测试 |
常见问题
- DeepSeek 生成的参考文献是真的吗?实测 66 条里 33 条「真实」(题名与第一作者均与数据库或刊方记录一致),一半不成立;真实且著录完整、能直接引用的 16 条,占 24%。
- DeepSeek 附了链接的参考文献能直接用吗?不能。链接常常真实、点开就是刊方页面,作者名单却与刊方记录不符,或者条目干脆不写作者。
- 开深度思考和联网搜索会让参考文献更准吗?没有一组过半。最新一次六组里最高的是「列要点+深思」50%,最低的是「随手问+深思」12%:同样开深思,问得越松反而越差。
- DeepSeek 给的参考文献主要错在哪里?五种:整条不写责任者(最常见)、作者名单与记录不符、刊名与卷号张冠李戴、DOI 解析不出或没附、文章编号与页码的偏移。
- 豆包给的参考文献比 DeepSeek 准吗?同一套测试的豆包篇:62 条中 45 条真实(73%)、28 条宜引(45%);快速模式会整条虚构,专家模式少凭空编但会张冠李戴。
- ChatGPT 给的参考文献比 DeepSeek 和豆包准吗?同一套测试的 ChatGPT 篇:61 条中 49 条真实(80%)、37 条宜引(61%),三家里第一个过半;开「思考」反而更差,10 条只有 2 条宜引。
本文为今日宜引文原创。转载请注明出处并附原文链接,不得修改、不得用于商业用途。

