大多数“AI visibility”仪表盘衡量的东西都不对。一篇博客发布后数字上升并不是证据——这只是穿上了实验服的相关性。
唯一诚实的设计:处理组 vs. 对照组
对于你上线的每一项优化,我们都会运行同一组 prompt 两次:
- 对照组 — 在你修改之前的 prompt 集,由引擎今天回答。
- 处理组 — 同一组 prompt,但你的修改已上线后。
lift 就是这个差值,相同的问题,相同的措辞。其他一切都是噪音。
公式
lift 以 prompt 集中引用率的变化来表示:
lift = citation_rate(treatment) − citation_rate(control)
其中 citation_rate 是在一个固定的、配对的 prompt 集中,你的品牌被点名、引用或暗示的 prompt 所占比例。
一个实例
假设有一组关于你所在品类的 200 个问题。修改前,你的品牌出现在其中 64 个中(对照组率 = 32%)。在经过一轮结构化主张验证冲刺之后,它出现在 92 个中(处理组率 = 46%)。
lift = 46% − 32% = +14 percentage points
相同的 200 个问题,同一天,其他什么都没变——这是一个被测量的效果,而非巧合。
对照组
32%
处理组
46%
Δ +14pp
置信度 95%
四个归因误报陷阱
即使设计严谨,团队还是会以四种可预见的方式自欺欺人:
- 新鲜感峰值。 大型发布那一周会推高提及量;你会把功劳算到错误的改动上。务必将处理组 prompt 集与同一天测量的对照组集配对。
- 季节性漂移。 Q4 品类关注度对所有人都会上升。12 月“出现”的 lift 其实只是日历效应。
- 单引擎海市蜃楼。 某个引擎改了默认设置;你却把它读成全局 lift。先按引擎分别报告,再聚合。
- 措辞重构伪影。 你改的是查询措辞,不是品牌。如果 prompt 集本身变了,前后对比就不可比。
用置信度报告,而不是凭感觉
单次观察只是轶事。我们在多个 prompt 集之间聚合,并报告:
- 变化的方向(被引用更多 / 更少)。
- 变化的幅度。
- 一个置信区间,让利益相关方知道该信多少。
这就是“我们觉得有效”和“这是被测量的效果,置信水平能让你的 CFO 接受”之间的差别。
为什么这对预算很重要
如果你无法为 lift 归因,你就无法为支出辩护。归因级别的验证把 GEO 从一项营销实验变成一个可衡量的支出项。