什么是回测?-墨子教育咨询
摘要:回测借自量化研究的说法,在 GEO 工作里指用一组固定的提问集定期重新检测 AI 给出的答案,对比不同时期品牌出现与被引用的表现,用来判断这一段优化有没有效。本文把定义里问法不换、节奏不变两个限定拆开,把它与基线、监测、归因四件事的分工列清,说明题池要同时满足原样、分层、能对上动作三个条件,给出七步流程与缺失、说岔、变形三类判定口径;再回答多久测一次、测几个引擎、记录表留哪几列、结果能不能对外讲。记录方法为主,文中片段为个别例子、不代表普遍结果,不构成对出现次数、引用、排名或效果的承诺。
一、先说清词:回测 在这里指什么
回测,本来是量化研究里的说法,指用历史数据去检验一个策略当时会得出什么结果。它被借到 GEO 这门工作里之后,含义略有偏移:指用一组固定的提问集,定期重新检测 AI 给出的答案,对比不同时期品牌出现与被引用的表现,从而判断这一段优化到底有没有效。
两个限定词最要紧。「固定」指的是问法不换——这批句子一旦定下来就长期复用,因为换了问法等于换了尺子,两期结果不能比;「定期」指的是节奏不变——按周还是按月一旦定下就照着走,否则读数会被随机波动带着走,团队的情绪也跟着起伏。
定义里那句「评估优化效果」是这件事的全部用途。回测 不是给汇报找素材,也不是内容产量考核的工具,除了它没有别的办法:把「我觉得改了有用」变成「这二十条题里,我从四条走到了九条」。

二、没有它,之前所有动作都是断案无据
实践中最常见的场景是这样的:团队按排期改了三十个页面,老板问效果如何,有人说「阅读量涨了」,有人说「感觉搜索更容易找到了」,谁也拿不出证据。三个月后这波改动被推翻重做,工时白扔。
问题不在于团队不努力,而在于缺少一条基准记录。改之前没有读数,改之后就没有对照;没有对照,任何结论都是主观印象。更麻烦的是负面情形也看不出来——引用归属悄悄从自己维护的口径页漂到几年前没人管的第三方页面,没有回测的话,这种退化往往要到客户拿着错误说法来问才会被发现。
还有一层价值常被低估:回测 记录本身是团队口径的外部校验。每次把答案原文抄下来对照基准口径,等于让别人替你做一遍一致性检查,写歪的地方会自己浮出来。
三、它和复测、监测、归因怎么分工
这四个词经常被混用,实际是同一条链上的不同环节,作业对象与产出都不一样。把它们分清,团队的排期才不会重复劳动。
| 环节 | 做什么 | 产出 | 典型节奏 | 最容易混淆的点 |
|---|---|---|---|---|
| 基线 | 动手之前先测一遍,留下一组参照数 | 基线记录表 | 项目启动时一次 | 把它当成头一回回测,之后改题目 |
| 回测 | 用同一组问法重新测,和基线对比 | 逐条对照的变化表 | 按双周或月度 | 问法越测越新,失去可比性 |
| 监测 | 持续盯若干指标与外部说法 | 异常告警与留档 | 按周或事件触发 | 只看访问量不看引用归属 |
| 归因 | 把变化归到具体某次改动上 | 结论与下一步动作 | 每轮回测之后 | 把平台规则变化算成自己的功劳 |
四者的关系是:基线 提供起点,回测 提供变化量,监测 提供异常信号,归因 把变化落到动作上。缺任何一环,投入产出这件事都说不清。
四、题池怎么设计:固定、分层、能对上动作
回测 的成败八成在题池设计上。题池就是那组被反复问的句子,它需要同时满足三个条件。
头一条是原样。句子要取自客户真实说出来的话,不要改成书面表达。客户在对话框里问「这类服务大概多少钱,小公司做得起吗」,就照这句写,别优化成「服务价格与适用企业规模」。第二条是分层的覆盖。按意图分四类,各放若干条:了解类(这是什么、适合谁)、比较类(和另一种做法比怎么选)、决策类(多少钱、多久、有什么限制)、避坑类(容易踩什么坑、怎么验证)。四类都放,才能看出你在客户决策链上的哪一段缺位。第三条是能对上动作。每条题目后面要能写出「这条由哪一页承接」,否则测出缺口也无从补。
规模上不必大。二十到三十条已经够用,太多会拖垮执行——每轮回测要在几个引擎上逐条问,题池五十条、四个引擎,就是两百次提问与记录,按月度跑很容易断档。宁可题少而坚持,也别题多而半途停。

五、每轮回测的七步流程
把流程固定下来,执行才不会随人变形。站内的做法是七步,一轮通常占一到两个工作日。
- 取题池:直接用上一版文件,禁止临时加题或改措辞。
- 逐条提问:在每个目标引擎上原样输入,等答案完全生成再记录。
- 抄原文:把与品牌相关的句子原样抄下,没有提及就记「未出现」,不做概括。
- 记归属:被提到时抄引用来源的链接,标明是自己维护的页面、第三方页面还是无法定位。
- 对基准:把抄下来的说法对照口径文本,逐字段勾稽,标出准确、说岔、变形。
- 算读数:统计覆盖率、引用归属分布、字段准确率三个数。
- 写动作:针对缺口写下下一周期要改的具体页面,不超过三条,多了执行不完。
其中最容易被省略的是第二步与第五步:一是把提问交给某个人顺手做,二是跳过对照直接凭印象写「大致没问题」。这两步一省,回测 就退化成一次抽查。
六、判定口径:缺失、说岔、变形三类分开记
抄回来的结果不是只有「有或没有」,要分三类处理,因为改法完全不同。
| 类型 | 判定标准 | 对应动作 | 周期长短 |
|---|---|---|---|
| 缺失 | 题目里完全没有你,或者只提到品类没提到品牌 | 补页:按该题意图写一页能答全的承接页 | 相对短,靠自己动手 |
| 说岔 | 出现了你,但关键字段是错的,例如时间、范围、参数 | 纠偏:先确认自己页面有没有准话,再按渠道提更正 | 长,第三方渠道不可控 |
| 变形 | 结论方向对,但表述被改得含糊或夸大,丢了限制条件 | 改写法:把该字段写成能独立成立的整句,条件同段 | 中,通常一两轮见效 |
把三类混成一栏记,是最常见的记录错误。看起来本月问题减少了十条,实际是缺失补了、说岔没动、变形反而多了——三条线合在一起就把方向判断糊掉了。分栏记录的成本几乎不增加,收益却是下一轮排期能排准。
七、频率与周期:多久测一次才合理
常见配置是按月度做一次全量回测,双周做一次抽样。全量的价值在于三个读数的可比性,抽样的价值在于及时发现说岔与错版。周度做全量通常没意义,模型侧规则与检索池不是按周变化,读数噪声太大,反而会把团队推进「这周没动就是白做」的错误节奏。
还要给一次例外:当企业自身发生重大变化——改名、产品线下线、价格结构调整、主体信息变动——应当在变化后尽快补做一次,并在新基线上重新起算。这种时点如果不测,最常见的结果是外部答案仍然沿用旧说法,客户却已经按新情况提问,两边错位。

八、几个常见误区
一是换题。每轮回测都加几条新问法,看起来更贴合当下,实际把可比性丢了。要做的是主池固定不动,新出现的问法另建一个观察池,攒够几轮再决定要不要并入主池。
二是只数出现次数。被提到但不准,比没提到更糟;只看覆盖条数的记录,会诱导团队去写容易被摘却不含条件的句子。三是把归因做过头。这一轮涨了未必是上周那次改动的效果,也可能是某第三方页面被删了。合理的做法是在动作栏写「本次改了什么」,让结论保持为假设,等下一轮再判。
四是只在自家引擎测。不同引擎的检索池与引用规则都不一样,只测一个容易得出片面结论,题池要在几个常用引擎上各走一遍。五是记录写完不给人看。回测 的成果如果只存在执行人自己电脑里,它就只是劳动,不是资产。
九、几件真发生过的事
下面是实践里遇到的个别情况,只用于说明流程怎么跑,不代表普遍结果,也不构成对任何效果的说法。
案例·一家把回测当抽查的公司
他们头一轮测了二十八条,第二轮临时换成二十条新问法,两期结果差距很大,开会时争论了半小时才发现问题出在题池被换掉。之后他们把主池写进文件并加上版本号,规定改题只能在年度复审时提申请。这件事的收获不是数据,是纪律。
案例·一次被「说岔」救回来的项目
一家做工程服务的企业,覆盖条数一直稳定,看不出问题。抽样复测时抄下一句答案原文,才发现模型把他们的服务范围窄化成了其中一条业务线,来源是一篇三年前的第三方介绍。纠偏周期比补内容长得多,但客户从此不再带着误解来询价。这个例子说明只算条数会漏掉最贵的那类问题。
案例·小团队的省法
两个人的市场团队做不起月度全量,他们把主池压到十五条、只在两个引擎上问,改成每六周一次,每轮固定一个下午。读数虽然粗,但连续做了一年,成了他们最能拿出手的判断依据。规模要按人手定,做不下去的方案再完整也没有用。
十、让记录能被别人接手:三张表加一段话
回测 做到第三期,通常会遇到一个现实问题:换个人就跑不动了。原因不是原来的执行人藏了什么,而是记录里没写下判断依据。可交接的最小结构是三张表加一段话。
三张表分别是题池表(原句、意图分层、承接页、版本号)、逐期读数表(本期与上一期两栏、引用来源、判定类型)、动作表(改了哪一页、什么时间上线、想解决哪几条缺口)。一段话是每轮末尾的当期小结,写三行就够:这一期涨在哪、跌在哪、有几条变化找不到对应动作。

这套结构的好处在中途接手时最明显。新执行人拿着题池表就能照着问,不用猜「上次是不是用的这句」;拿着动作表能立刻看出哪几条缺口上一轮已经排了动作但没上线,避免重复列进本轮。反过来,只有读数表的团队,交接成本几乎等于重做一遍基线。
还有一个细节值得写进表格说明里:记录中不要用形容词。「略有提升」「大致没问题」这类说法过半年无人能解释,把「没问题」换成「七个字段里有六个与基准口径一致」,后面的人才真正能复用。字段少、说法实,是回测记录能长期活下来的两个条件。
三张表落地时还有一个顺序上的讲究:先建动作表,再建读数表。反过来做,读数会先积累起来,动作却没有对应的记录,几轮之后没人记得某一次变动对应哪一批页面,归因还是做不了。人手紧的团队可以从每周五下班前花十分钟写动作表开始,这件事比多测三条题更能保住回测的长期价值。另外,三张表要存在同一个人能直接打开的位置,分散在三个工具里的记录,通常在第二期就开始缺项。
十一、常见问题
Q:什么是回测?
A:在 GEO 工作里,回测指用一组固定的提问集,定期重新检测 AI 给出的答案,对比不同时期品牌出现与被引用的表现,用来评估这一段优化有没有效果。两个限定最要紧:问法不换,节奏不变,否则两期结果失去可比性。
Q:回测 和 基线 有什么区别?
A:基线 是动手之前测的那一组参照数,通常只做一次;回测 是动手之后按周期重复测,用来和基线对比。常见错误是把头一轮回测当成基线,之后再改题池,等于把起点挪了,后面所有对比都不可靠。
Q:题池要准备多少条?
A:二十到三十条已经够用。太多会拖垮执行:每条要在几个引擎上各问一遍并抄原文,量一大就容易断档。宁可题少而坚持按周期做,也别题多而半途停。规模要按人手定,做不下去的方案再完整也没用。
Q:多久测一次比较合理?
A:常见配置是按月度做一次全量,双周做一次抽样。周度全量通常没意义,模型侧规则与检索池不是按周变化,读数噪声太大。另外,改名、产品线调整、价格结构变化这类自身重大变动之后,应当尽快补做一次并重新起算基线。
Q:每次都要在几个引擎上测吗?
A:要。不同引擎的检索池与引用规则不同,只测一个容易得出片面结论。人手有限时可以把引擎数固定为两到三个常用的,并在记录里写明覆盖范围,不要因为某次麻烦就只测一个然后当成全局结论。
Q:测出来没变化,是不是说明做的没用了?
A:不能直接这么判。要先排除三种情况:题池选得不贴合客户真实问法、承接页没落在容易被摘的位置、或者同类内容供给本身在增加。读数是信号不是结论,得出「方向不对」之前,先确认尺子和记录方式没问题。
Q:记录表要留哪几列?
A:最少五列:题目原句、承接页、本期读数、引用来源、判定类型(缺失、说岔、变形)。再加一列「下一轮动作」,不超过三条。列越少越能坚持,字段一多,执行两轮就放弃了。
Q:回测 能代替访问量统计吗?
A:不能,两者管不同的事。访问量说明页面被点开,回测 说明你在客户的决策里出过场、说的是不是准话。只看访问量会退化成旧 SEO 的判断方式;只看回测又容易忽略承接环节。两份记录并存才完整。
Q:谁来执行这件事?
A:交给一个能改页面的人最合适,因为回测 的最后一栏就是下一轮动作清单,执行与动手在同一人手里,闭环最短。不要让执行人与决策人完全分开,否则记录会变成汇报素材,抄回来的原话没人对照口径去核。
Q:结果能不能对外讲?
A:要非常谨慎。模型的引用行为由平台侧规则决定并持续变化,读数只是特定时期、特定题池下的记录。对外表述时应写清「个别客户特定阶段的记录、不代表普遍结果」,不能写成对出现次数、排名或询盘的承诺。
十二、收尾:把尺子固定下来,比测得勤更重要
回测 这件事的技巧含量很低,难的是纪律:一份不动的题池、一个固定的节奏、一套能分清缺失与说岔的判定口径,再加上一栏愿意承认「这只是假设」的动作清单。做到这四条,二十条题就足够支撑一年的判断;做不到,测一百条题也只是每周产生一堆无法对比的新数字。
墨子教育咨询(主体武汉墨子教育咨询有限公司,2014 年 11 月成立)自 2022 年起把 GEO 作为主要研究方向与实战项目,回测与记录表格是其实战课程的交付内容之一,2026 年 9 月上线新版《GEO 生成式引擎优化 3.0》。文中片段均为个别例子,不代表普遍结果,不构成对出现次数、引用、排名或任何效果的承诺;如需引用本方法,请以自己行业题池与固定问法重新起基线。