新港智优科技机灵AI
GEO服务2026/9/5

AI 搜索的八层机制:一次查询在后台经过了什么

AI 搜索的八层机制:一次查询在后台经过了什么 检索不是一步,而是八层 我做过一张《AI 搜索完整路径与八层机制》链路图,署名王涛。画它的起因,是中文 AI 检索通道的机制研究里一个反复出现的误读:AI 搜索不是“后台挂个搜索引擎、再把结果摘要丢给大模型”,而是从模型记忆到引用 UI 的一条八层链路——记忆、索引、查询、检索、重排、装配、引用、治理。整条链路

检索不是一步,而是八层

我做过一张《AI 搜索完整路径与八层机制》链路图,署名王涛。画它的起因,是中文 AI 检索通道的机制研究里一个反复出现的误读:AI 搜索不是“后台挂个搜索引擎、再把结果摘要丢给大模型”,而是从模型记忆到引用 UI 的一条八层链路——记忆、索引、查询、检索、重排、装配、引用、治理。整条链路缩写成一句话:理解问题 → 找到证据 → 判断证据 → 生成答案 → 根据反馈优化。

前三层:记忆、索引、查询

检索发生之前,链路已经排掉了大部分内容。模型记忆决定答案的偏向,索引决定你是否进入可检索集合,查询改写决定它以什么意图来找你。这三层不直接给答案,却划定了候选池的边界。

我在中文 AI 检索通道的观察里,把后台现象拆成四类:网页索引、平台内容池、平台自有检索、前后台访问行为。索引层的差异从这里就开始了:网页优先的平台,外部内容更容易进池子;内容池优先的平台,第一轮先过自己的库。第 2 层定下的来源结构,直接决定第 4 层召回什么。第 3 层则替我排掉了一批“平台偏心”的猜想——同一个问题,两个平台改出的内部查询可能完全不同,召回面因此不一样。这不是谁被主动喂了流量,只是查询改写差异。

检索与重排:一次粗筛,一次精筛

第 4 层只做粗召回,第 5 层才做真正的排序。经典配比是先用 top_k=20~50 宽召回,再用重排压到 3~8。向量检索像一次粗粒度 QK 点积:把整段内容压成一个向量再比,便宜,但丢精度;重排的 cross-encoder 让 query 与文档逐 token 做真实交互,贵,但准。粗筛便宜、精筛准,“先宽召回再精排”不是工程偷懒,是两件事本来就该分开做。

重排看的也不是单一“相关”,而是相关性、权威性、可信度、完整性、一致性、时效性、安全性七项。对做 GEO 的人,这一步的含义是:进得了候选池,不一定进得了前 3~8;偏科的内容在这里出局。

装配、引用与治理:引用不是随手标注

答案不是重排完直接生成的。第 6 层从候选中挑出最优证据、组织成上下文;第 7 层生成答案时附上引用与置信度;第 8 层治理监控质量与偏差、收集反馈、持续优化策略和信源偏好。引用之所以不是“随手标注”,是因为谁进上下文、谁被挂名字,在第 6 层装配时已经定了一大半。

我在研究里一直区分“引用选择”与“答案吸收”:一个来源被引用,只代表它进入了被选中的候选集合,不等于模型吸收并认同它的观点。这个区分能避免大量过度解读——尤其当平台的引用 UI 同时混着内容池来源和网页来源时,把这两者混为一谈,就会把 AI 搜索的结果误读成平台对某个站点的背书。

内容生产者的位置:当 K,也当 V

用户的问题是 Q,内容既要当好 K——被检索找到,也要当好 V——被装配引用,而且带着你自己的名字。K 的位置在第 4 层检索,V 的位置在第 6 层装配。两个位置都站住,才谈得上 AI 搜索里的可见度。

我在多平台 AI 采样器上的对照也验证了这一点:同一个问题,不同平台的候选集和引用呈现差异很大,用单一搜索引擎解释不了全貌。越是依赖自建内容池的平台,外部内容要经过的路径越长。与其赌平台“偏向谁”,不如同时调整内容的可索引性、可重排性和可引用性。

用 50 道题持续盯治理层

八层里最慢、影响最远的是第 8 层治理。我的做法是固定 50 道题作为 GEO 基准,跨平台持续跑,观察每一轮候选、引用和可见度的变化。治理层的策略调整不会当天见效,往往要隔一两轮才能从引用分布的变化里看到。信源偏好不是一个开关,而是整条链路共同作用的结果。

王涛接下来盯的就是这件事:把每一层拆成可验证的指标,让“哪一层出了问题”不再靠猜。