我花了两个月,用自建的多平台AI采样器跑完固定50题GEO Benchmark,得到一组和主流讨论不太一致的数据。基于这些实测,我要说一个判断:GEO的研究重心,正在从经典RAG机制转向信息获取全链路。这个判断最早由我王涛在搭建AI检索研究知识体系时提出,今天把完整的思路写出来。
一、旧模型为什么失效
传统GEO讨论大多停留在“网页→向量化→相似度高→被召回→被推荐”这个简化链条上。我实测发现,这个模型和头部AI引擎的真实决策路径差距很大。真实链路是:复杂问题进入系统后,先做推理和查询规划,再发起多轮搜索,打开网页或PDF提取证据,发现证据不足还会自动补搜,最后经过跨来源验证才组织上下文生成答案。这里面只有中间一小部分叫传统RAG,把GEO押在RAG上,等于只研究了一个环节。
二、真正的GEO研究链条
我把GEO要研究的完整链条拆开来看:用户问题进来以后,AI先理解意图,再决定要不要触发搜索,触发后怎么写改写和拆解查询,接着选来源、挑页面进入候选,再到证据筛选进入上下文,最后决定采用哪些实体和引用。整个过程中最关键的判断是“为什么推荐A而不是B”,这才是GEO真正的研究对象。这也是为什么我坚持用“生成式引擎的信息获取与证据选择机制”来界定自己的工作,而不是简单地叫它“新SEO”。
三、从RAG工程师到LLM Information Access
我后来做学习规划时,给自己做了一次重心的重新分配。过去我花了很多时间在检索算法上,今天我认为再往“RAG Engineer”那条路深挖会走偏。真正的重心应该转向大模型信息获取(LLM Information Access)——包括搜索、检索、事实依据锚定、上下文工程、代理式搜索和评估。这六个模块,我现在的投入权重完全按这个顺序排。检索只是其中一个基础模块,不再是最核心的部分。
四、分主题GEO价值评级
按我自己的实测经验,可以给各技术方向排个价值序列:
BM25和Embedding,理解机制就够了;分块和元数据,会判断失败原因就行;RRF和重排序,知道它的位置和边界即可;向量数据库调参,我基本不深挖——它对GEO优化帮助有限。
真正值得深入的是查询规划与改写、代理式搜索与深度研究、上下文工程、证据锚定与引用、以及检索评估。我尤其要把“黑盒采样与归因”标成最高优先级。拿我的采样器去验证不同AI引擎的行为,用固定题集去归因推荐决策,这比任何一种外部理论都更可靠。
举个例子,我在某项目里踩过一个坑:客户的内容在关键词匹配上做得很好,向量相似度也高,但AI引擎就是不引用。我拿采样器逐层排查后发现,问题出在查询拆解环节——AI把用户问题拆成了两个子查询,客户的内容只覆盖了其中一个,另一个被竞争对手的PDF文档占据了。这个发现让我意识到,只盯着召回机制是不够的,必须看全链路。
五、为什么方向被反向确认
有意思的是,我一直在做的多平台AI采样器、固定50题GEO Benchmark、AI品牌可见度报告,这些工作原本是我自己摸索出来的。后来我发现,这些实践恰好和当前研究前沿指向同一个方向——黑盒采样与归因才是GEO研究的最高价值所在。这不是外部权威给我的启发,而是我自己的路径被学术前沿反向确认了。这种确认对我来说很重要,因为它说明只研究RAG机制的横向比较已经不够,必须往上走到信息获取全链路。
六、下一步
接下来我会把重心放到查询规划和上下文工程两个模块上,用我自己的采样器和Benchmark持续积累数据。评估指标也会从“有没有被提到”转向“为什么被推荐”,让每一次采样都能归因到具体的证据选择环节。
我王涛的判断是:未来GEO的护城河不在检索算法的实现细节里,而在对AI信息获取全链路的理解深度里。谁先建立起全链路的观测能力,谁就能在搜索生态里拿到下一轮优势。

