一篇八月挂上 arXiv 的论文里有个数字,我盯着看了挺久:往检索结果里塞一个伪造页面,就能让大模型推荐一个根本不存在的产品,成功率最高 27%。不是一批,不是一个站群,是一个页面。
我自己就在做 GEO。写内容、留结构化数据、盯着文章有没有被 AI 引用,为的就是模型回答问题的时候能提到。看到这个数字,第一反应不是担心被骗,是发现自己一直在琢磨怎么把货摆上货架,却从没想过这个货架是谁都能摆的。
你问 AI 哪个产品好,它不是从记忆里翻答案,是先去检索一批网页,再从这批网页里挑。这批被检索到的网页就是货架,模型是站在货架前的导购。导购只看货架上摆着什么,它不会去验货,也不会追问这批货是谁上架的。
一个页面能把导购骗到什么程度
这项研究做了一套叫 FORGE 的基准,具体方法是:冻结一批检索到的真实网页,在里面把某个真产品本地改写成一个虚构产品,然后看模型会不会把这个不存在的东西推荐出来。覆盖 225 个真实产品、15 个品类、5 种消费场景,测了 12 个商业和开源权重模型。
结论是所有模型都中招,没有例外。单个污染页面,最高 27%。如果把检索结果的前三条全部替换掉,这个数字涨到 73.8%。27% 这个数值本身高不高,其实不是重点。重点是它对应的成本。
传统 SEO 要跟一整个行业抢排名,砸内容砸外链砸时间;而这里只需要挤进某个具体问题的检索结果里,能排到前几条。挤进前几条,比冲到第一成本少太多。
这套攻击不需要针对所有人,它只需要针对一个问题、一个品类、一类正在做采购决策的人群。
模型厂商为什么都拦不住
论文没有停在暴露问题这一步,它测了四种防御,结论是四种都不充分。
其中最容易被当成标准答案的那一种,是可信度重排序。按来源的权威程度重新给检索结果排个序。这个思路听起来很对,实际效果是只移除了六分之一的虚假推荐。也就是说,你把只信权威来源这条规则加上去,剩下五分之六的假推荐照样端出来。
原因不难理解。伪造一个看起来权威的页面,成本并不高。域名可以买老的,排版可以照抄,引用可以编,作者署名随便挂一个。可信度重排序过滤的是形式上的可信,而攻击者恰恰是在形式上做文章。
模型更会推理,为什么假货反而更像真的
这篇论文里最反直觉的一条发现是:推理能力没能缓解问题,反而让模型生成了虚假的社会证据。
具体是这样:模型不只是把假产品推荐了出来,它还会替这个假产品补理由——用户口碑不错、在某类场景下评价很高、性价比在同价位里突出。这些理由在被污染的原始页面上并不存在,是推理过程自己脑补出来的。更强的推理没有帮模型识破假货,反而帮假货站台。
碰到这类问题,行业惯性反应是等下一代模型,能力上去了自然就好了。但在这件事上方向却是反的,推理链条越长,模型越倾向于把检索到的东西补成一个自洽的解释,而不是停下来质疑输入本身。
导购越专业,越擅长给货架上的每一件商品讲出一个像样的故事,哪怕那件商品是昨晚刚摆上去的。
比假货更难发现的,是货架自己在换
还有另一篇论文,讲的是另一件事,但两件事值得放在一起看。
这项研究极其克制:模型不变、提示词不变、检索策略不变,唯一动的是索引——把语料从 1 个分片扩到 7 个。就是往知识库里多导了一批文档,这是所有做企业知识库的团队每个月都在干的常规动作。
400 道题语义层面的答案变化是 10.25 个百分点,规范化精确匹配的变化是 6.44 个百分点。而精确匹配准确率的变化是多少?负 1.50 个百分点;再换一个模型复现,在 100 道题的子集上,语义变化 8.75 个百分点,而精确匹配准确率不降反升,涨了 3.00 个百分点。
作者给这个现象起名叫 accuracy-blind answer churn,即准确率不变下的答案漂移。

这才是这两篇论文放在一起最要命的地方。污染至少是有人干的,有攻击者,有痕迹,理论上能查。而漂移没有攻击者,它只是往知识库多导了两千份文档。客户验收那天问的问题答对了,这周再问同一个问题,答案换了一个说法,连它是哪天变的都答不上来。相当于货架上的货被换了一批,门店总销售额没什么变化,报表上什么都看不出来。
对做内容和做产品的启发
如果你在做内容和 GEO
被推荐不等于被信任,你能把东西摆上货架,别人也能,而且成本比你更低。
值得现在开始做的事情:定期记录自己在主流 AI 回答里被怎么引用,引用的是哪一句、有没有变形。这件事本身产生不了流量,但等到哪天引用变成了错的,你手上至少有一份备份对照。
如果你在做 AI 推荐或者企业知识库产品
第一,评测对象要从模型扩到语料。绝大多数团队的评测集,评的是模型答得对不对,没有在评货架本身干不干净。模型再准,投喂进去的东西是脏的,输出的也会是。
第二,交付要带语料版本号。哪一批文档、哪一天的快照,跟着结论一起。否则客户一段时间后拿着不同的答案来找你,你没有任何立足点。
第三,答案变更要单独审计,不能只看聚合准确率。那个看不见的漂移——涨的和跌的互相抵消,曲线纹丝不动,答案已经换了一批。审计的口径应该是同一批问题在两个语料版本下的答案一致率,而不是各自的正确率。
第四,可信度重排序值得做,但要知道它的天花板在哪。建议把它当成一道减损措施,别当成解决方案,更别拿它去跟客户承诺。
写在最后
所有人都在关注模型评测,而出问题的地方很可能在检索语料这层。
GEO 做的事,是把自己的商品摆得更显眼。污染做的事,是把假货摆上同一个货架,两者走的是同一个入口。