新港智优科技机灵AI
GEO研究2026/10/4王涛(Taomir)

跨平台GEO度量框架:从多源数据整合到效果评估的系统化指南

把来源展示、答案支持和品牌提及分开记录,明确事件、分母、人工标注与跨平台比较的边界,让GEO月报可以复核并指导下一步内容动作。

一个页面出现在AI回答的来源列表里,这次曝光就值得记录。但如果要判断页面有没有帮助构成答案,还需要打开来源,逐段检查回答用了什么。

这两个问题对应不同的内容动作。页面没有进入可见来源,要检查可抓取性、问题覆盖和信源;页面已经被列出,却找不到能对应的事实或解释,则需要检查它是否真正回答了问题。把两种情况合在一个“引用次数”里,月报很难指导下一步。

我更愿意把GEO月报拆成两层,先看来源是否被选择,再看回答中能否确认该来源的贡献。这个区分来自Zhang Kai、He Xinyue、Yao Jingang的公开预印本《From Citation Selection to Citation Absorption》。下面给出的手工标注和月报口径,是基于这个区分整理的应用方法,需要与论文的原始指标分开理解。

先分清来源展示、答案支持和品牌提及

来源展示比较容易观察。目标URL有没有出现在平台公开显示的来源列表里,可以从回答原文、页面或截图核对。

答案支持需要多做一步。假设回答列出了公司的案例页,正文却只用了另一家机构的数据,这个案例页有可见曝光,但在当前证据里还没有找到它对答案的具体贡献。反过来,回答可能转述某页的事实,却没有展示这条URL。后者需要单独记录,不能偷偷算进“已显示来源”的统计。

品牌提及又是另一项结果。回答可以提到品牌而不引用官网,也可以引用官网而没有推荐品牌。做内容曝光、提高品牌识别、影响推荐结果和验证答案准确性,目标各有差别。

因此,月报里至少应把品牌提及、目标来源展示、回答支持分开。某个指标上升是否达到客户目标,还要回到项目事先约定的验收规则;不能因为新增了吸收指标,就把其他目标都宣布为无效。

论文的吸收评分,与本文的手工标注不同

源论文使用citation selection与citation absorption区分来源选择和答案贡献。在论文第5.2、5.3节,吸收采用多项加权的influence score作为观察代理量。它不是模型内部注意力、隐藏候选池或因果依赖的直接测量。

团队手工审查月报时,未必具备复现整套评分的条件。本文采用更窄的指标,叫“答案支持确认率”,记录在可审查的来源事件中,有多少能找到明确对应的答案支持。它是本文自定的人工吸收标注口径,不是原论文influence score的复现,也不能与论文中的平台均值直接比较。

这个指标少了一些细节,却有一个实际好处。复核人员可以打开某次回答和当时的来源副本,检查具体哪一句支持了哪一项判断。如果找不到对应证据,就保留不确定状态。

从原始记录到可复核的标注

先固定问题清单、平台范围和测试条件,再取得完整回答与来源列表。测试时间、模型或模式、是否联网、会话条件以及异常,都应与原始答案一起保存。题集调整要生成新版本,不能一边优化内容,一边悄悄换成更容易出现品牌的问题。这一步可以沿用固定题集与评分版本的方法和重复采样实践。

接着,为每条显示来源建立一个事件。本文把事件定义为“一次有效回答×一个目标URL”。同一回答里,同一个URL出现三次,选择事件仍记一次;出现位置和次数可以另列字段。一次回答列出两个目标URL,就形成两个事件。域名级统计也可以做,但要先说明是否合并同域名页面,不能混用URL和域名的分母。

来源副本应尽量在采样时保存。几天后重新打开页面,内容可能已经更新;用新版网页解释旧答案,会造成版本错配。无法取得当时正文,或者来源只能看到摘要,就把限制记下来,不做完整页面已经被审查的假设。

对每个可审查事件,我建议使用三种标注。

标注 怎样判断 应保存的证据
明确支持 答案中的具体事实、数字、步骤或解释,能够与来源中的对应内容相互核对 答案片段、来源片段、对应的论断,以及判定理由
未找到支持 已检查当前可取得的答案和来源,未找到足够明确的对应内容 检查范围与原因;它不证明平台内部完全没有使用该页
无法判断 来源过于通用、多个页面共享事实,或答案表达不足以区分来源贡献 不确定原因,以及需要补充的证据

另设“来源无法审查”,处理正文缺失、登录限制、页面失效或历史版本无法取得等情况。这类事件仍属于被列出的来源,但不进入可审查事件的分母。

逐字相同可以帮助定位,不能单独证明归因。很多页面都会说“企业需要保留原始数据”,这类公共表述很难确定来自哪一页。带明确出处的统计、特定案例、独有定义和完整步骤,更容易形成可复核的对应关系。即便如此,我们确认的仍是可见文本支持,不是平台内部的因果过程。

自动工具可以先定位相似段落,再由人核查。首次使用标注规则时,应抽取不同平台和不同结果的样本让两人独立判断,记录分歧并修订规则。后续规则改变,重新标注或注明版本,不能把新旧结果直接拼成趋势。

分母要跟着指标一起出现

在一个平台、一个题集版本和一个时间窗口内,先定义以下数量。

数量 含义
有效回答数 按预先约定的有效样本规则进入统计的回答数
选择事件数 有效回答中公开显示的目标URL事件数
可审查事件数 具备可用来源正文和答案、已完成审查的选择事件数,包含“无法判断”
明确支持事件数 可审查事件中标为“明确支持”的数量

然后分别报告。

  • 目标来源展示率=显示至少一个目标URL的有效回答数÷有效回答数。一个回答出现多条目标URL,也只进入分子一次。
  • 来源审查覆盖率=可审查事件数÷选择事件数。它说明来源缺失对结果影响有多大。
  • 答案支持确认率=明确支持事件数÷可审查事件数。它表示当前证据能够确认的支持比例,不是所有来源实际被吸收的真实比例。

“无法判断”保留在确认率分母里,并单列数量和占比;不能把它描述成已经确认“未被吸收”。来源无法审查的事件也要单列。若相应分母为零,指标记为“不适用”,不要显示成0%。

这里有两种统计单位,回答和来源事件。它们可以放在同一份报告里,但必须分列标明。否则一次回答引用很多URL的平台,会在汇总中获得不合适的权重。

一个月报算例

下面是计算示意,不是客户数据,也不是王涛的实验结果。假设只观察一个目标URL,同一平台得到20次有效回答,其中8次显示该URL,因此有8个选择事件。

6个事件取得了可用来源正文并完成审查,2个无法取得当时正文。在6个可审查事件里,3个明确支持答案,2个未找到支持,1个无法判断。

项目 计算 示意结果
目标来源展示率 8÷20 40%
来源审查覆盖率 6÷8 75%
答案支持确认率 3÷6 50%
无法判断占可审查事件比例 1÷6 约16.7%
无法审查事件 2个,另列原因 不能省略

这份结果可以写成,“20次有效回答中,8次展示目标URL;其中6次完成来源审查,3次找到明确对应的答案支持。”不能简化成“官网有50%的真实吸收率”,也不能把8次展示都当成已支持答案。

如果数据量大到无法全部检查,应事先确定抽样方法。按平台、问题类型和时间分层随机抽取,保留抽取清单,避免只挑出现品牌的漂亮回答。只标注抽样数据时,报告抽样范围和审查数;未经适当估计与加权,不把样本比例写成全量结果。

按平台看广度与支持,才知道该改哪里

源论文观察到不同平台的引用广度和单来源影响存在差异。这个结果提醒我们分平台报告,并不提供永久不变的平台规则。研究覆盖的ChatGPT、Google AI Overview/Gemini与Perplexity,也不能代表豆包、元宝或DeepSeek的行为。研究与平台边界

月报可以分成两张表。第一张按平台报告来源展示、目标URL覆盖和有效回答数;第二张报告审查覆盖、支持确认结果、不确定项和典型答案片段。题集、测试条件或来源取得率明显不同的平台,先解释差异,再比较比例。

如果页面经常展示,却很少找到明确支持,我会先看回答到底需要什么。它要比较产品,页面是否提供了比较条件;它问具体服务范围,页面是否有清楚的主体、地区和适用边界;它需要证据,页面是否给出有来源、有时间的事实。

这些检查会得到具体修改项。关键定义可以独立成段,步骤可以写完整,数据可以附原始出处,含糊的推广句可以换成可核对的事实。页面变长本身不保证效果提升;修改后仍要用同一套题集复测,分别观察来源展示和回答支持有没有变化。

做下一份月报时,先从一个平台、一组固定问题开始。挑出已经显示目标URL的回答,保存来源副本,把答案片段与对应证据连起来。团队能够复核这张表以后,再扩展平台和自动标注规模,会比先追求一个漂亮的综合分数更稳妥。

参考资料