

2026 年了,AI 给的参考文献,还有多少是编的?——豆包篇
一、引言
先看一条豆包给出的参考文献:
赵军,刘康,何世柱,等。知识图谱构建技术综述[J]. 计算机研究与发展,2022, 59(10): 2216-2239.
期刊是真的,三位作者都是这个领域的真学者,卷期页码也在合理范围。但《计算机研究与发展》2022 年第 10 期没有这篇文章:同名综述确实在这本期刊上,发表于 2016 年第 3 期,作者是刘峤等另一批人。真题名、真期刊,配上假作者、假年卷页,这样的条目混在文献列表里,肉眼几乎挑不出来。
本系列上一篇测的是 DeepSeek:59 条参考文献,宜引 18 条(31%)。这一篇用同一套测试问豆包。
豆包给出的参考文献,整表粘贴进今日宜引文逐条核验,真实条目附来源记录,查无此文的现形。
二、方法
2.1 测试设置
测试对象:豆包网页版,取每组第一次输出。
变量:三种问法 × 两种模式(快速:新对话的默认态;专家:模型选择器中标注「专家」的豆包 2.1 Turbo,生成前有显式思考过程),每组新开对话、互不共享上下文。豆包另有「深入研究」功能,属独立的报告生成入口,不在本次测试范围。
三种问法按提问的详略程度设置,prompt 原文与 DeepSeek 篇相同(如下):



2.2 判定标准
- 真实:存在唯一真实文献与该条对应,题名与第一作者均与数据库或刊方记录一致。
- 完整:依据 GB/T 7714(2025版),引用文献的必备著录项都有且与真实记录一致。
- 宜引:真实且完整的条目。
2.3 核验流程
将豆包给出的参考文献逐条通过我们的应用(今日宜引文)核验,在其基础上人工点开来源记录逐条确认,确保结果的可靠性;62 条中,应用判定与人工核对方向均一致。

图 4 组 3(列要点·快速)在应用中的查真结果:10 条全部命中真实记录,通过率 100%。这是六组中的最好情形——仅「列要点」问法的两组全部条目真实(表 1),其余四组最低至 10%;且真实不等于宜引,该组著录完整率仍只有 70%。
三、结果
| 问法 | 快速 | 专家 | 平均宜引率 | ||
|---|---|---|---|---|---|
| 真实 | 完整 | 真实 | 完整 | ||
| 随手问 | 100%(12/12) | 50%(6/12) | 70%(7/10) | 40%(4/10) | 45% |
| 提要求 | 10%(1/10) | 0%(0/10) | 50%(5/10) | 40%(4/10) | 20% |
| 列要点 | 100%(10/10) | 70%(7/10) | 100%(10/10) | 70%(7/10) | 70% |
| 平均 | 70% | 40% | 73.33% | 50% | 45% |
注:表中平均为各组比率的算术平均。
总计:62 条中,真实条目共 45 条;宜引条目共 28 条;张冠李戴(题名对作者不对,或作者对题名不对)共 5 条;整条虚构共 12 条。
- 两种模式的总体真实率几乎相同(快速 72%,专家 73%,按条目数计),差别在问法与错法。
- 最像正经文献列表的一组几乎全军覆没。「提要求+快速」组输出条条有作者、字段齐整、编号连贯,10 条里 9 条在公开数据库与刊方记录中不存在。DeepSeek 篇里「看起来最规整的一组宜引率反而最低」,在豆包身上重演。
- 在 prompt 里写明「引用真实存在的期刊论文」「不确定真实存在的不要引用」并要求附 DOI 的「列要点」问法,两种模式下真实率都是 100%,但宜引率都停在 70%:提问技巧能减少凭空编造,替代不了逐条核对。
观察项:六组输出均为编号条目,即顺序编码制,均未标注 GB/T 7714 版本号。「提要求+快速」一组的输出为独立「文档」卡片,正文与参考文献分开展示。专家模式生成前有显式思考过程,思考记录里出现过筛选来源(「CSDN 的不够权威,继续查找」)和替换存疑条目(「计划替换第 8 篇论文」)的动作。应用对六组的体例识别均为 GB/T 7714 · 顺序编码,依 2025 版标准核对。
四、主要错误形态
本次 62 条的错误集中在四种形态:
1. 整条虚构(12 条):期刊名真实、卷期页码合理,库中查无此文,其中 9 条集中在「提要求+快速」一组。数条属于「套壳」:刊名、卷期、第一作者全部真实,题名被改换了几个词,与库中任何一篇真文献都对不上。
2. 张冠李戴(5 条,全部出自专家模式):引言那条是一例。另一条题名属于《中文信息学报》2026 年一篇真实文章,作者却写成了完全无关的三个名字;还有一条把某论文七位真实作者中的第五至第七位列为前三作者。这类条目刊名是真的,作者是真的,卷期页码看着也合理,但拼出来的那篇文献并不存在,粗略核查难以发现。
3. DOI 三种情形:真文献配了一个全球未注册的假 DOI;真文献的 DOI 停在投稿流水号上,与刊方最终发表号差一串日期;用户明确要求「期刊论文」时,给出 arXiv 预印本充数(附的 DOI 倒是真的)。
4. 同文多形态:同一篇真实综述在两个组里各出现一次,页码分别标注 1921-1945 与 1947-1969,刊方记录为 1947-1965,两次都不对,错得还不一样。另一篇真实文献同样两组两现:一次带全卷期页但页码与刊方记录不符,另一次只剩年份与 DOI,卷期页整体缺失。同一篇文献的著录,在不同回答之间对不上。
五、结论
豆包给出的参考文献,73% 确有其文,比「AI 文献全是编的」的印象要好,但无论是投稿还是论文,这个真实率都远不过关;其中能不加修改直接引用的只有 45%,仍未过半。错的那部分也越来越不像「假的」:真期刊、真学者、真 DOI 前缀,单独看每一项都查得到,合在一起的那篇文献却不存在。AI 给出的参考文献,即便字段齐整、附了 DOI,也只能作为线索参考,逐条核验之后才能引用。
交稿前整表核一遍:今日宜引文逐条比对,真题名配错作者一类的条目在此现形,导出按目标体例渲染。
常见问题
- 豆包生成的参考文献是真的吗?本次实测 62 条里 45 条「真实」(题名与第一作者均与数据库或刊方记录一致),占 73%;真实且著录完整、能直接引用的 28 条,占 45%。
- 豆包快速模式和专家模式,哪个给的参考文献更准?总体真实率几乎相同(快速 72%,专家 73%),差别在错法:快速模式会整条虚构,「提要求+快速」一组 10 条里 9 条查无此文;专家模式很少凭空编,但会张冠李戴,六组共 5 条全部出自专家模式。
- 怎么问才能让豆包少编参考文献?在提问里写明「引用真实存在的期刊论文」「不确定真实存在的不要引用」并要求附 DOI:加了这句的两组真实率均为 100%,但宜引率停在 70%,字段仍需逐条核对。
- 豆包给的 DOI 能信吗?三种情形都出现过:真文献配全球未注册的假 DOI;真文献的 DOI 停在投稿流水号上,与刊方最终发表号不同;要求期刊论文时给出 arXiv 预印本充数(DOI 倒是真的)。
- DeepSeek 和豆包,谁给的参考文献更可靠?同一套测试:DeepSeek 59 条宜引 18 条(31%),豆包 62 条宜引 28 条(45%);两家都未过半,错的形态不同。
本文为今日宜引文原创。转载请注明出处并附原文链接,不得修改、不得用于商业用途。
