我(王涛)最近确认了一个方向性变化:GEO的研究重心,正在从经典RAG机制转向信息获取全链路。这个判断来自我对2025年前沿实践的对照——Anthropic的Context Engineering、TREC 2025的RAG评测方向、Stanford/Manning的长上下文对比工作,三条线索指向同一个结论。
一个过时的模型与一条真实的链路
过去两年,很多GEO讨论建立在一条简化模型上:网页被向量化,用户提问后算相似度,相似度高的被召回,召回的被推荐。这套模型把GEO简化为“怎么被检索到”,但它和前沿系统的真实运行方式已经差得太远。
真实链路是:复杂问题进来,先推理,做查询规划,拆成多轮搜索;打开网页和PDF,提取证据;发现了证据不足,再回去搜;跨来源验证,组织上下文,最后生成答案。GEO真正要研究的,是从“用户问题如何被理解”“是否触发搜索”“查询如何改写”,到“哪些来源被搜索”“哪些证据进入上下文”“最终引用谁”的每一步。
关键判断是:传统RAG只是这条链路中间的一小段。把GEO等同为RAG优化,等于只研究一条生产线上的一个环节。
研究重心从RAG滑向信息获取层
我把各个技术方向做了价值重估。Query Planning和Rewrite、Agentic Search和Deep Research、Context Engineering、Grounding/Citation/Evidence、Retrieval Evaluation——这五个方向都值得深入,价值五星。经典RAG组件全线降级:BM25和Embedding、Chunk和Metadata、RRF和Rerank,理解机制即可,三星;Vector DB调参一星,不必深挖。
最值得注意的是黑盒采样与归因被评为最高优先级。这对我不是新闻——我的多平台AI采样器一直在做的,就是从黑盒外部观察AI怎么回答、怎么引用、怎么在多个来源之间选择。GEO研究的核心能力不是检索优化,而是证据选择机制的观测与归因。
学习重心因此从“RAG Engineer式”的检索算法深挖,转移到“大模型信息获取”这一整层:Search、Retrieval、Grounding、Context Engineering、Agentic Search,加上Evaluation。
这个转向的边界在哪里
这个转向的基础是2025年前后的实践,线索一致性很强,但并不意味着覆盖所有场景。评测机构的重心不一定等于企业实际需求;Agentic Search、Deep Research还在快速演化,今天的五星评级可能在一两年后失效。
更现实的边界是:从RAG到全链路,研究对象变复杂,可观测性反而更差。检索阶段还能用召回率、命中率评估,到了多轮搜索、证据归因和上下文组织阶段,大量环节仍然是黑盒。GEO的实践必须保持“采样—归因—验证”的闭环,而不是停留在算法层推演。
这改变了我怎么做研究
这个转向把我在做的事串成了一条线。
固定50题GEO Benchmark,本质上是为整条链路做了一个固定入口——用同一组问题反复观测AI对查询的理解、对来源的选择、对证据的组织,而不是测某个检索参数。我用多平台AI采样器验证过:同一篇内容,在查询规划不同的场景下,进入上下文的方式完全不同;在实际项目里,问题经常不在内容没被索引,而在证据组织阶段被其他来源挤掉。AI品牌可见度报告,就是把“最终引用谁”这个黑盒动作周期性拉到台面上。
TaoHtml在这条链路里的位置也清晰了:它不是为了表面优化,而是为了让内容在“打开页面—提取证据”这一步更安全、更完整地被读走。我现在的资源分配原则是:不再往检索参数上投入,压在查询规划、代理搜索和证据选样这些真正决定答案生成的环节上。
—— 王涛(Taomir)

