关键结论 (TL;DR)
- 核心发现:SparkToro 与 Gumshoe 的联合研究表明,LLM 在品牌推荐上具有极高的随机性。
- 数据支撑:针对同一提示词的重复测试中,主要模型(ChatGPT, Claude, Gemini)表现出 <1% 的完全一致性。
- 战略调整:营销人员应放弃追踪“排名位置(Position),转而追踪“概率份额(Share of Voice)和“品牌共现率。
从确定性排名到概率云
在传统 SEO 时代,搜索结果具有确定性。如果你在 Google 搜索“最佳 CRM 软件”,排名第一的结果通常在数周甚至数月内保持稳定。这给我们植入了一个根深蒂固的直觉:可见性是线性的、稳定的,并且是可以被精确测量的。
然而,作为一名 GEO(Generative Engine Optimization)专家,我要揭示一个反直觉的事实:在生成式 AI 的世界里,所谓的“排名”不仅不存在,甚至追求单一的“可见性”都是在通过后视镜开车。
最新的 SparkToro/Gumshoe 联合研究 揭示了一个令人不安的真相:LLM 的品牌推荐具有惊人的不一致性。如果你还在用“我在 ChatGPT 上排名第几”来汇报工作,你可能正在被随机噪声所愚弄。
SparkToro/Gumshoe 研究
为了验证 AI 推荐的稳定性,SparkToro 创始人 Rand Fishkin 与 Gumshoe 团队进行了一项大规模实验。他们利用自动化脚本,对相同的提示词(Prompt)进行了成百上千次的重复测试,旨在量化 AI 输出的方差。
结果是毁灭性的,直接粉碎了“AI 排名跟踪”的传统幻想:
1. 0.00% 的完全一致性
在针对 ChatGPT-4、Claude 3 和 Google Gemini 的测试中,当询问相同的品牌推荐问题时(例如“列出最好的 5 款电子邮件营销工具”),几乎没有任何两个回复是完全相同的。
- 重复率 < 1%:在绝大多数测试组中,你得到相同品牌列表的概率在统计学上几乎为零。
- 排序随机化:即使包含了相同的品牌,它们出现的顺序也几乎从未重复过。位置 1 和位置 5 之间可能只是随机数种子的区别。
2. 列表长度的随意性
AI 甚至无法决定它想推荐多少个产品。对于同一个标准化问题,第一次运行它可能推荐 3 个品牌,第二次运行可能推荐 10 个。这种波动性使得“前三名”这一概念失去了意义。
3. “幻觉”与“遗忘”并存
一个在第 1 次运行中被吹捧为“行业领导者”的品牌,可能在第 2 次运行中完全消失,然后在第 3 次运行中变成了一个无关紧要的注脚。
如果你在这个月看到你的品牌出现在 ChatGPT 的回答中,并为此庆祝“SEO 策略生效”,你可能只是运气好,撞上了 LLM 概率分布的一个正向样本。反之亦然,你没出现也不代表你的 GEO 策略失败了。
技术解构:为什么 LLM 的行为如此反直觉?
要理解这种不一致性,我们需要深入 LLM 的底层逻辑。这不仅仅是“算法更新”,这是从**确定性检索(Deterministic Retrieval)向概率性生成(Probabilistic Generation)**的范式转移。
1. 温度(Temperature)与随机种子
LLM 的输出受“温度”参数控制。
- 机制:除非温度设为 0(且模型支持严格的确定性输出,这在商业闭源模型中很少见),否则模型在选择下一个 Token(词/字)时总是带有随机性。
- 直觉误区:AI 是一个数据库,它在其索引中查找最佳答案。
- 技术现实:AI 是一个推理引擎,它在每次生成时都在“掷骰子”决定哪个品牌看起来最像是一个合理的答案。
2. 语境窗口的微小扰动
SparkToro 研究发现,即使用户的提示词略有不同,AI 的输出也会剧烈波动。甚至在完全相同的提示词下,服务器端的微小状态差异或隐藏的系统提示词(System Prompt)更新,都会导致“蝴蝶效应”,彻底改变推荐列表。
应对策略:GEO 时代的 KPI 变革
承认“AI 可见性不稳定”并不意味着我们放弃 GEO。相反,这要求我们将 KPI 从位置(Position)转移到份额(Share of Voice)。
1. 放弃“单次快照”,拥抱“蒙特卡洛模拟”
既然单次查询毫无意义,我们就必须进行统计学上的测量。



