新港智优科技机灵AI
GEO服务2026/9/8

GEO 采样为什么必须固定题集、题集哈希与评分版本

GEO 采样为什么必须固定题集、题集哈希与评分版本 2026 年 7 月,固定 50 题企业 GEO Benchmark 落地,设计者署名王涛。七类题族、题集 hash、模板版本、评分版本、盲测防泄漏和控制题隔离逐一部署,其中一轮单平台 50 条样本全部有效。这个 Benchmark 要解决的问题只有一个:动态题集和混合评分会让 GEO 采样结果不可比较。下

2026 年 7 月,固定 50 题企业 GEO Benchmark 落地,设计者署名王涛。七类题族、题集 hash、模板版本、评分版本、盲测防泄漏和控制题隔离逐一部署,其中一轮单平台 50 条样本全部有效。这个 Benchmark 要解决的问题只有一个:动态题集和混合评分会让 GEO 采样结果不可比较。下面是我为什么把这三样东西钉死。

一、动态题集让跨轮比较失去意义

GEO 采样最核心的诉求是跨轮比较:这一轮优化后,品牌可见度比上一轮高了多少?如果每轮都在换题,这个比较无从谈起——分数变了,你分不清是检索配置改进了,还是题目变难了。

关键区别在于:基础模型 Benchmark 的题集是通用能力的抽样,题目本身不重要,过拟合意味着作弊;企业 GEO 的题集代表真实客户会问的问题,题目本身就是目标。基础 Benchmark 隐藏题集是必需的,防止针对性优化;企业 GEO 隐藏题集没有意义——企业本来就该知道客户问什么。基础 Benchmark 的成功标准是泛化到没见过的题;企业 GEO 的成功标准是在这些题及其语义变体上稳定出现。固定题集,是把跨轮比较变成同一套卷子上的前后对比。

二、题集真实性与"定向过拟合"

固定题集有一个前提必须成立:题集必须真的覆盖真实客户问题。否则就是"精准优化了错误目标"——过拟合到一组假问题上,测出来很好看,业务上毫无用处。

所以我在设计 50 题时坚持七类题族:自然发现、场景发现、品牌考虑、主体认知、比较、证据风险和方法控制。每一类对应客户决策链路的一个环节,漏掉一类,采样结果就对那一类问题失明。题集真实性直接决定这个方法是有效还是有害。

三、题集哈希与版本冻结

固定题集不是口头固定,是机制固定:题集 hash、模板版本、评分版本三者一起冻结,一轮实验才算真正锁定。

我做过一次采样分析管线的重构,从那以后给自己定了一条纪律:结果冻结不可重算。某轮跑完的分数,哪怕后来发现评分标准可以改进,也不准回头重算——一重算,整条比较链就塌了。50 条样本全部有效的那轮,就是在这套冻结机制下跑出来的——不是碰巧,是每一环都钉死之后,数据才敢拿来比。

四、评分版本必须独立于题集版本

评分版本和题集版本必须分开维护。题集变了是考察范围变了,评分变了是判断标准变了,两者混在一起,任何分数差异都无法归因。

我在"基础提及"的拆分上踩过坑:提及定义不清,会让"不确定提及"多于"明确提及",整批数据因此不可用。后来我把基础提及拆成四项分别记录:品牌直问识别、泛词自然曝光、推荐提及、证据提及。这四项分开,才能定位品牌可见度到底在哪个环节掉了——是品牌被问到时认不出来,还是没被问到时就根本不出现。同时也要划清边界:用户问题里本来就重复了品牌名、品牌只出现在搜索链接里、名称相似但实体错误,这些都不算有效提及。

五、固定参数与可比性验证

题集、hash、评分版本都固定后,采样参数也得固定。我在采样系统里固定 top_k=10;加重排则 first_top_k=30、rerank_top_n=5。动态 k 更灵活,但报告分数难解释——动态调整会让两次采样的对比条件不一致。

比较两轮结果之前,还要先验证这两轮确实可比:题集 hash 一致、评分版本一致、采样参数一致。我踩过的坑告诉我:缺数据不能假装是 0,客户文案不能把"未判断"和"零结果"混成一句话。这些都不是指标计算的问题,是工程纪律的问题。

收尾

一套 GEO 采样系统要可信,靠的不是"指标算得对",而是四条工程纪律:结果冻结不可重算、比较前先验证可比性、缺数据不能假装是 0、客户文案不能把"未判断"和"零结果"混成一句话。这四条来自一次采样分析管线重构的真实工程过程,每一条都对应一个已经踩过的坑。固定题集、题集哈希与评分版本,就是把纪律落到机制上的起点。王涛把这个起点做成了可复现的 50 题 Benchmark——不是为了测出来好看,是为了让每一轮优化都能被诚实比较。