如果你已经做了一段时间的内容优化,大概率遇到过这种情况:同一个问题,AI 的答案里出现了一句你写过、别人也写过的事实,但引用挂在别人的页面上。你的页面不是没被找到——它就在检索结果里。
2026 年 9 月 14 日,Sriram Selvam 和 Anneswa Ghosh 在 arXiv 公开了一篇研究(编号 2609.15164,标题为 CITECHOICE: A Causal Audit of How Document Presentation Redistributes Citation Credit in Agentic Search),专门处理这个环节。他们把"多个文档都支持同一句事实、引擎只引用其中一个"这件事称为引用分配(citation allocation),并且指出一个关键定性:被引用的那个不一定更正确,这是一次分配决策,不是一次正确性判断。
这个区分值得先记住,因为围绕"排版能不能让 AI 引用我"的讨论,经常把两件不同的事混在一起:文档有没有机会被收进来,和文档被收进来之后分到多少引用额度。这篇论文用受控实验说明,排版对小标题、列表、表格这类改动的支持证据,只出现在后一件事上。
这项审计怎么做的
样本来自真实的代理式检索记录,不是人工构造的测试题。一个 GPT-5.4 代理被要求必须先搜索再回答,最多进行 5 个模型轮次,每轮最多发起 3 次并行搜索;每次搜索经由 Exa 返回 5 条结果,每条结果附最多约 1 万字符的页面正文和元数据。所有原生消息、请求、响应和重试都被存档。研究从 500 条人工修订过的查询中分层抽取了 130 条日常问题,其中 129 条成功获取,最终形成 113 组进入重放的"竞争对"——每组里的两个文档是在同一次调用中返回的,并且都被独立确认支持同一个事先指定的事实;盲审复核确认其中 103 组属于严格的同一命题。
真正让这篇论文有分量的,是它的重放设计。研究没有直接比较两个不同页面,而是从同一批归档证据出发,联合生成两版改写:一版是连续段落、不含标题、列表、表格的散文;另一版使用 Markdown 小标题、短段落,以及确实有助于扫读的项目符号或表格。两版被要求保留相同的事实、数量和限定条件,词数差控制在 25% 以内,还有确定性校验器强制散文版不得出现任何结构标记。然后每组竞争对做 4 次重放,交叉两个因素:用哪一版渲染目标文档,以及目标文档和竞争文档在本次调用中的先后位置。每次只改动这一个声明过的变量,其余记录全部冻结,只重新生成最终回答。
也就是说,这是一次把"排版"当作干预手段、把"位置"也当作干预手段的因果审计,而不是相关性统计。
结构化渲染确实改变了分配结果,但只是分配
第一组结果和很多人的直觉一致:结构化版本分到了更多引用。目标文档在被换成结构化渲染后,每条答案平均多出 0.50 次引用(95% 置信区间 [+0.20, +0.84],Holm 校正后 p=.033)。
但同一段结果里有两个限定条件同样重要:总引用数没有增加,竞争对手的引用也没有减少。这说明增加的那部分额度是在既有分配里重新挪过来的,不是把蛋糕做大。
第二组结果就没那么符合直觉了。研究事先指定要检验的"目标文档是否至少被引用一次"这个发生率效应,估计值是 +4.5 个百分点,置信区间 [-1.4, +10.4] 跨过零(p=.168)。论文的措辞是"不确定"——不是证明无效,但也不足以支撑"改排版能提高被收进来的概率"这种说法。作者在讨论部分把这条边界讲得很直白:有支持的效应是集中,不是准入。
"排在前面的更常被引用",为什么不能直接当因果
这是全篇最容易被误读的一组数据。
先看观察结果:在归档记录里,第一次出现时排在第 1 位的文档,被引用的比例是 85.1%;排在第 5 位的是 42.8%。两者相差 42.3 个百分点。这个梯度很大,也符合几乎所有做内容的人的体感,所以很容易被直接翻译成"把内容往上挪就能赢"。
再看受控结果:当研究只交换目标文档与竞争文档的先后位置时,发生率效应是 +7.9 个百分点(95% 置信区间 [+1.1, +14.9];原始 p=.035,Holm 校正后 p=.350)。而在另外 56 组单独做位置交换的留出竞争对里,估计值正好是 0.0 个百分点([-5.4, +5.4])。
| 观察到的现象 | 容易得出的结论 | 受控实验的回答 |
|---|---|---|
| 第 1 位被引率 85.1%,第 5 位 42.8% | 排名靠前是主要原因 | 受控重排只有 +7.9pp,留出集为 0.0pp,观察梯度被高估 |
| 结构化版本每答案多 0.50 次引用 | 加小标题和列表就能提高被引用率 | 总引用未增加、竞品未减少,被收进来的概率仍不确定 |
| 换一版排版后引用变多了 | 这次改动有效 | 单次判定有约 15% 会翻转,不能据此下结论 |
位置确实是真实存在的因素,但观察到的差距里混入了别的东西——文档本身能被引用,和它恰好被放在前面,这两件事在真实记录里同时发生。论文在机制检查部分也说明,没有出现稳定的"某种列表标记"或"某个排名配方"。作者在讨论中的原话是:呈现方式可以在证据相当的来源之间移动可见的额度,但被支持的效应是集中而非准入,竞争者的位置没有变化,也没有稳定的列表标记或排名配方出现。
更该注意的一件事:引用判定本身有噪声
第三组结果对日常工作的影响,可能比排版效应更大。
研究把 30 组冻结的竞争对用全新解码重跑了一遍。聚合的引用数效应可以复现——这部分是稳的。但约 15% 的二元判定发生了变化,也就是"引用/没引用"这个二选一的结论,每七次里就有一次会翻转;解码过程本身解释了单次生成中约 45% 的效应方差。
换句话说,如果你今天改了一版页面,明天问同一个问题,发现 AI 引用你了,而后天再问它又没引用,这未必是你的改动起效又失效。在这个测量口径下,单次问答的结果随时可能只是解码噪声。这也解释了为什么"优化前截一张图、优化后再截一张图"这种证明方式在方法上站不住:它把一个高噪声的二元判定当成了稳定读数。
对内容工作意味着什么
把上面的结果合起来,可以得出一个比较克制的判断:排版不是没用的,但它起作用的位置和很多人以为的不一样。
一个实际动作是把指标拆成两个,分开记录。第一个是是否被引用,回答"我的页面有没有被系统用上";第二个是被引用了几次,回答"在被用上的文档里我分到多少额度"。这项研究表明排版改动对第二个量有支持的效应,对第一个量没有确定结论。如果两个量混在一个"AI 引用率"里看,你无法判断问题出在哪一层——这也是一次 AI 可见度诊断到底应该诊断什么想先解决的分层问题。
第二个动作是改掉验证方式。既然约 15% 的判定会翻转,单次前后对比就不构成证据。可行的最低标准是固定同一个问题、同一台引擎,重复提问多轮,把每一轮的"是否被引用"和"被引用次数"都记下来,再看两次改动之间的差异是不是稳定地偏向一方。这不需要额外工具,只需要愿意多问几次并如实记下不一致的结果。
第三个动作是别把这件事当配方用。论文作者在伦理说明里专门写了这一点:因为这类发现可能鼓励发布者在不改进证据质量的前提下优化呈现方式,他们刻意把结果连同不确定性一起报告,并将其定位为审计诊断,而不是优化指引。判断一篇内容值不值得被引用,仍然要回到它是否说清了对象、时间、条件和结论——这一点和昨天讨论的 grounding 检索是同一件事的另一面:检索阶段决定你的内容有没有机会进入考虑范围,分配阶段决定进来之后引用挂在谁那里。
边界与还没解决的问题
这项研究的适用范围比标题看上去窄,需要写清楚。
它是 arXiv 上的预印本(v1,2026-09-14 提交),arXiv 页面没有标注会议或期刊收录信息,尚未经过同行评审。样本是英文日常问题,检索只经过一个提供商、每次调用固定返回 5 条结果,代理只有单一模型。研究只处理已经进入检索结果的文档之间如何分配引用,不涉及能否被抓取、能否被索引,也不涉及答案对其他来源的吸收程度。中文语境、国产模型和元宝、豆包这类产品是否表现出类似的分配行为,目前没有公开、可复核的数据可以回答。
论文自身的功效限制也值得说明:89 个独立族里,主要发生率效应只有 28 个不一致族,在 80% 功效下只能可靠检出 8.5 个百分点以上的效应,所以 +4.5pp 的估计属于未决,而不是零。AIGEO.GURU 没有复现这项实验,本文引用的数字与统计均来自上述公开展示的论文,分析与判断部分属于 AIGEO.GURU 的解读。
如果要给自己留一个可以马上用的问题,可以是这样:上一次你说"这次改动让 AI 更常引用我们了",比较的到底是同一个问题、同一台引擎的多轮结果,还是两次单次运行?如果答案是后者,那还不是证据,只是两次采样。这项研究最结实的一条结论,大概就是这句话本身。
本文由 AIGEO.GURU 官网日更流程整理:资料核验、初稿撰写与编辑校对过程有 AI 参与,发布前按本站编辑标准逐项自查;文中的事实、数字均标注来源,分析与判断部分属于 AIGEO.GURU。本站没有独立复现该论文的实验。