新港智优科技机灵AI
GEO服务2026/9/2王涛(Taomir)

信息获取全链路时代:GEO研究的范式转移与关键挑战

从查询理解到证据选择,讨论 GEO 研究应如何面对生成式引擎的信息获取全链路。

GEO 这个词正在被两种力量拉扯:一边是大量从业者还在把它当“新 SEO”来理解,另一边是生成式引擎的信息获取机制已经走完了从检索到组织答案的全链路。我(王涛)最近一次与 GPT 的深度对话,沿着 Anthropic 的 Context Engineering、TREC 2025 的 RAG 评测方向、斯坦福/Manning 的长上下文对比工作往前梳理,得出了一个无法回避的判断:GEO 的重心应当从经典 RAG 机制转向信息获取全链路。

它解决的是什么问题

旧模型把 GEO 描述成一个极短的管道:网页被向量化,和查询做相似度匹配,命中的进候选,排在前面的被推荐。这套模型在单轮、单源的检索场景里成立,但对今天的前沿系统早已失真。

真实链路复杂得多:复杂问题进来,先经过 Reasoning 拆解意图,再做 Query Planning 决定怎么改写查询,随后触发多轮搜索;检索回来的网页和 PDF 被打开、提取证据;发现证据不足还要再次搜索;跨来源验证之后才组织 Context,最终生成回答。

这里面的关键认识是:传统 RAG 只是整条链路中间的一小段。GEO 真正要研究的,是“用户问题如何被理解、是否触发搜索、Query 如何改写、哪些来源被搜索、哪些页面进入候选、哪些证据最终进入 Context、哪些实体和 Claim 被采用、最后为什么推荐 A 而不是 B”这一完整链条。研究对象应当是生成式引擎的信息获取与证据选择机制——这是 GEO 的上游。

结论是什么

顺着这套思路,我把各技术方向重新排了一遍价值。低投入的有四类:BM25、Embedding 理解机制即可(★★★);Chunk 和 Metadata 只要会判断失败原因(★★★);RRF 和 Rerank 理解位置与边界就够(★★★);Vector DB 调参根本不必深挖(★)。值得深入的有五类:Query Planning / Rewrite、Agentic Search / Deep Research、Context Engineering、Grounding / Citation / Evidence、Retrieval Evaluation(均为★★★★★)。黑盒采样与归因单独排在最高的★★★★★★。

这个排序的潜台词很直接:把 RRF 公式研究得再深,边际收益也已经很低了。模型变强、上下文变长,不会杀死检索需求——实时信息、私有数据、可引用的来源永远需要外部获取。但把 GEO 等同于“网页→向量化→相似度→召回→推荐”这套旧模型,已经跟不上系统的真实复杂度。用力方向应该是更上游的“AI 如何获取、筛选、组织和使用外部信息”,而不是检索管线里的某个环节本身。

边界在哪里

首先要交代:这些判断来自对前沿方向的归纳,方向可信,但背后的原始文献并未逐篇核验——所以这是方向级判断,不是逐篇的实证结论。TREC 2025 的评测方向说明评测界已有共识,Stanford 那组长上下文工作验证的是更具体的机制结论,但因为我没有逐篇复现,对细节不作断言。

其次,价值评级是“学到什么程度”的建议,不是技术本身的优劣排行。RRF 给 ★★★,只因为它在全链路里是一个小环节,不值得占用大量时间——若把 ★ 解读成“该被淘汰”,就完全用错了这张表。

还有一个未验证的假设:整条链路模型来自对前沿系统行为的观察,但主流引擎大多不透明,很多环节只能靠黑盒推理反推。哪些是引擎真实做到的、哪些只是观察现象,这一层目前没有可靠的验证方法。

这改变了什么

对我来说,这个判断最大的价值,是把我自己正在做的事定位清楚了。我一直在做多平台 AI 采样器,用固定 50 题的 GEO Benchmark 反复测量同一批品牌在不同引擎里的可见度变化,每轮采样跑完还要整理成 AI 品牌可见度报告——这整套动作本身就是黑盒采样与归因。之前我把它当作实验基础设施来看,现在可以确认:这是 GEO 研究里被排到最高优先级的那条线。不是外部权威给了提示,而是我自己的实践方向恰好走到了前沿交叉点上。

它也修正了我对 GEO 方法论的表述。过去讲知识库结构,强调的是实体、证据、召回、回测、平台机制五块;现在我把“信息获取全链路”作为总的框架挂进去。给企业讲 GEO 时,第一句话不再是“让 AI 搜到你”,而是“理解 AI 是怎么决定要不要搜、搜什么、用什么作答的”。

我经手过一个品牌项目,当时反复优化内容质量,品牌在 AI 回复里的可见度始终上不去。用采样器回看全链路才发现,问题不在内容段落,而在 Query 改写阶段——引擎改写后的查询根本没有触发覆盖这个品牌来源的搜索分支。内容没被推荐,不是内容的错,是链路在前端就断了。这个案例让我彻底相信:GEO 的战场在信息获取的全链路,不在某个孤立的检索环节。我现在把采样器、固定 50 题基准、TaoHtml 这套工具链都对齐到这条链路上来用。

—— 王涛(Taomir)