什么是深度研究污染?
深度研究污染是指有人在 AI 研究代理惯常抓取的公开用户生成页面上加入一段文字,使代理最终产出的报告重复攻击者的说法。康奈尔科技学院(Cornell Tech)的研究人员把这种手法命名为 WARP,即网页代理检索污染。整个过程不需要接触 AI 系统本身。
关键在于攻击者不需要什么。不需要模型权限,不需要 API key,不需要知道你的具体提问字句,也不需要新建网站或购买域名。
他只需要在一个本来已经有排名、而且代理本来就会抓取的页面上补一段短文字。一条 Reddit 留言就够了。
这与你平时被训练去防范的失败模式并不相同。幻觉引用指向一条根本不存在的网址;被污染的引用却指向一条真实网址,落在真实的高权重论坛上,串连着一整条真人讨论。你点进去,一切看起来都正常。
13 个字如何操控一个 AI 研究代理?
研究人员先侦查哪些用户生成页面会被代理稳定抓取,然后在其中一页补上大约 13 个字的指定文字,再重跑一组相关查询。代理产出的报告开始偏向那段植入内容,条件提及率介于 38% 至 51%。
以下是这篇研究的核心事实,你可以自行核对,不必只相信本文的转述。
研究事实摘录
--- 论文:Deep-Research Agents Can Be Poisoned via User-Generated Content,arXiv 2605.24245,2026 年 5 月 22 日发布
--- 作者:Tingwei Zhang、Harold Triedman、Vitaly Shmatikov,Cornell Tech
--- 攻击名称:WARP(Web Agent Retrieval Poisoning)
--- 受测开源代理:STORM、Co-STORM、OmniThink
--- 植入内容规模:在一个既有用户生成页面上补约 13 个字
--- 报告效果:在一组相关查询中,条件提及率 38% 至 51%
--- 攻击者所需条件:能在代理本来就会抓取的页面留言,仅此而已
请留意「一组相关查询」这个说法。攻击者不需要猜中你的提问方式。他污染的是整个主题,而任何合理措辞的同类问题,最终都会经过同样那几页。
2026 年 6 月,Search Engine Land 与 404 Media 分别作了独立报道,两者都把实际风险定义为商业层面而非学术层面:把买家推向某个产品,或者推离某个竞争对手。
为什么「核对引用来源」已经不够?
核对引用能抓出伪造来源,却抓不出一个真实但内容本身就是为了被检索而写的来源。如果你点开链接,看见一条活生生的讨论帖便打勾放行,你只证明了那一页存在,并没有证明那个说法得到任何可信者支持。
大部分从业者的核查习惯只有两种,而两种在这里都会失效。
第一种是在二十条引用中抽查两三条。污染是概率性攻击。如果植入说法会在大约一半的相关报告中出现,你抽中那唯一关键段落的机会其实很低。
第二种是相信代理自身的语气。深度研究输出读起来像顾问公司的简报。有条理的结构只是排版选择,不是证据;被污染的说法会继承与有据可查的说法完全相同的权威语调。
这件事在 2026 年比一年前更重要,原因很实际。深度研究模式现在已经是许多工作的默认答案界面,不再是尝鲜功能。报告会被贴进简报、引用在客户邮件里、用来支撑预算申请,而下游看到的人往往从未看过涉及了哪些来源。
当一个说法被重新排版成一张幻灯片,它就不再像检索结果,而像你团队亲口断言的事实。那一刻,一句植入的句子开始变得昂贵。
另外还有更广的可靠性背景:一项针对约 250 万篇论文、共 1.11 亿条参考文献的审计指出,仅 2025 年的论文中就有数万条属于幻觉、实际不存在的引用。伪造与污染是两个不同的问题,一套核查流程必须同时挡住两者。
如何在 10 分钟内核实一份深度研究报告?
先按后果排序,只针对真正承重的说法,并且核查来源的类型而非来源是否存在。四个步骤:标出会左右决策的说法、把每个引用分类为一手或用户生成、在排除用户生成内容的条件下重跑同一问题、比较两次输出中消失了哪些说法。
步骤一:标出会改变你决定的说法
一份二十页报告通常只有三、四个说法真正改变你下一步的行动:一个价格、一个上限、一个具名供应商推荐、一个法规期限。把它们标出来,其余暂时不管。
步骤二:把支撑这些说法的来源分类
分成两桶。一手来源包括供应商文件、官方定价页、监管申报、更新日志、已发表论文。用户生成来源包括 Reddit、Quora、论坛、留言区、社群维基、聚合式清单文章。
一个会左右决策的说法若只靠用户生成来源支撑,那不算已核实。那是一则加了脚注的传闻。
步骤三:排除用户生成内容后重跑同一问题
这一步几乎没有人做,却正是暴露污染的关键。要求它再做一次同样的研究,但限定一手来源。两次都存活的说法大致可信;只在无限制那次出现的说法,就是你该深挖的地方。
步骤四:所有商业数字回到供应商官方页面
价格、使用上限、试用条款、功能是否可用,供应商的实时页面是唯一算数的来源。花三十秒核对,永远胜过读一段语气肯定的摘要。
用哪一条提示可以让 AI 审核自己的报告?
把报告贴回模型,要求它为自己的证据分类,而不是为结论辩护。以下这条提示正是这样设计的。它会产出一张你能在一分钟内扫完的表格,并且明确禁止模型重新论证原本的答案。
立即试用这条提示
--- 你正在审核一份研究报告的检索污染风险,不是改写它。不要重述或维护报告的结论。
--- 以下是我生成的研究报告。针对每一个会改变商业决策的说法,输出表格一行,字段包括:说法、来源类型(官方文件/已发表研究/新闻/用户生成)、来源网址、风险(高/中/低)。
--- 只要一个会左右决策的说法仅由论坛、Reddit、留言串、社群维基或聚合式清单文章支撑,风险一律标为高。
--- 表格之后另外列出:(1)所有你无法追溯到具体网址的说法;(2)所有我应该回供应商官方页面确认的商业数字,例如价格、使用上限、试用条款。
--- 最后用一句话指出:若哪一个说法其实是被植入的,会造成最大损失。
--- 以下是报告:[贴上报告]
最后一项指令才是真正有用的部分。它强迫模型排序,而不是丢出一堵免责声明,并且直接告诉你剩下五分钟该花在哪里。
如果你想理解为什么这类约束能如此稳定地改变输出品质,那正是我们在情境工程一文中拆解的同一套机制。
这套核查流程会在哪里失效?
它会在四个可预期的地方失效。知道这四点,决定了你会长期沿用这套流程,还是一星期后就放弃。
模型不一定看得见自己的检索轨迹。有些工具会列出所有抓取过的网址,有些只显示经过整理的子集。如果一份二十页报告的来源清单整齐得可疑,就把这次审核视为部分完成,而非全面完成。
排除用户生成内容会牺牲真实信号。论坛确实是了解一个工具在每天使用三个月之后表现如何的最佳来源。目的不是封杀它们,而是不让它们默默独自承担一个决策。
自我审核缺乏对抗性。模型评改自己的产出,没有动机去挖得够深。用另一个模型来审核撰写报告的那个模型,是一项小改动,却能明显提高拦截率。
攻击面不只是 Reddit。任何可由用户编辑、又有良好排名的页面都算。社群维基、问答网站、评论区、GitHub 讨论、高权重媒体下方的留言串,全部属于同一类。
接下来 20 分钟该测什么?
找出你最近一份真正据以行动的深度研究报告,套用上面那条审核提示,数一数有多少个左右决策的说法只能追溯到用户生成页面。大部分从业者至少会找到一个。这个数字告诉你,你现有流程有多依赖信任。
然后做更不舒服的那个版本。请任何 AI 助手推荐你所在类别的供应商,看它倚重哪些来源。如果一条你从未见过的论坛讨论在替你做决定,那条讨论已经成为你竞争格局的一部分。
这些都不代表深度研究不值得用。它把一星期的桌面研究压缩成二十分钟,这笔交易依然非常划算。它只是说,你省下的二十分钟不该全部用来庆祝。
懂AI的冷,更懂你的难 UD 同行28年,让科技成为有温度的陪伴。
本文由 UD AI 团队审阅。
🔍 看清 AI 到底怎样说你
如果一个陌生人的论坛留言就能左右 AI 的答案,那你更值得知道 AI 现在怎样描述你自己的品牌与内容。UD 的 AEO Auditor 会检查答案引擎如何读取、引用与推荐你的页面。当你准备把一套可信的研究流程建立起来,UD 团队手把手带你完成每一步,从来源政策、提示模板到最终复核。