大多数“AI visibility”仪表盘衡量的东西都不对。一篇博客发布后数字上升并不是证据——这只是穿上了实验服的相关性。

唯一诚实的设计:处理组 vs. 对照组

对于你上线的每一项优化,我们都会运行同一组 prompt 两次:

  1. 对照组 — 在你修改之前的 prompt 集,由引擎今天回答。
  2. 处理组 — 同一组 prompt,但你的修改已上线后。

lift 就是这个差值,相同的问题,相同的措辞。其他一切都是噪音。

公式

lift 以 prompt 集中引用率的变化来表示:

lift = citation_rate(treatment) − citation_rate(control)

其中 citation_rate 是在一个固定的、配对的 prompt 集中,你的品牌被点名、引用或暗示的 prompt 所占比例。

一个实例

假设有一组关于你所在品类的 200 个问题。修改前,你的品牌出现在其中 64 个中(对照组率 = 32%)。在经过一轮结构化主张验证冲刺之后,它出现在 92 个中(处理组率 = 46%)。

lift = 46% − 32% = +14 percentage points

相同的 200 个问题,同一天,其他什么都没变——这是一个被测量的效果,而非巧合。

引用率 · 对照组 vs 处理组
对照组
32%
处理组
46%
Δ +14pp 置信度 95%

四个归因误报陷阱

即使设计严谨,团队还是会以四种可预见的方式自欺欺人:

  1. 新鲜感峰值。 大型发布那一周会推高提及量;你会把功劳算到错误的改动上。务必将处理组 prompt 集与同一天测量的对照组集配对。
  2. 季节性漂移。 Q4 品类关注度对所有人都会上升。12 月“出现”的 lift 其实只是日历效应。
  3. 单引擎海市蜃楼。 某个引擎改了默认设置;你却把它读成全局 lift。先按引擎分别报告,再聚合。
  4. 措辞重构伪影。 你改的是查询措辞,不是品牌。如果 prompt 集本身变了,前后对比就不可比。

用置信度报告,而不是凭感觉

单次观察只是轶事。我们在多个 prompt 集之间聚合,并报告:

  • 变化的方向(被引用更多 / 更少)。
  • 变化的幅度。
  • 一个置信区间,让利益相关方知道该信多少。

这就是“我们觉得有效”和“这是被测量的效果,置信水平能让你的 CFO 接受”之间的差别。

为什么这对预算很重要

如果你无法为 lift 归因,你就无法为支出辩护。归因级别的验证把 GEO 从一项营销实验变成一个可衡量的支出项。