怎么自己动手测“品牌在 AI 里的可见度”?一套可复制的自测方法-墨子学院

摘要:不用买工具,一张问题表加一个记录模板就能开始测。本文给出固定问题集的建法(三层问题、数量建议)、测试的标准化动作(同问法同环境多次重复)、和一份可直接抄的打分记录表。

"品牌在 AI 里到底看不见得着?"这个问题不需要买工具、不需要等服务商报告,一张问题表、几个引擎账号、一小时就能自己测出可信的答案。这篇把整套自测方法写成可复制的操作手册:问题集怎么建(三层结构、数量、来源)、测试怎么做标准(环境、次数、记录)、结果怎么打分成表。照做一遍,你就有了属于自己的第一份可见度基线。

品牌AI可见度自测三步:问题集重复测记录表

一、自测前必须接受的三个统计事实

先立规矩,避免白测。第一,同一问题不同时间答案可能不同——生成式引擎有随机性,单次结果没有解释力,所以每个问题至少重复 3 次。第二,不同引擎差异巨大——用户用什么你就测什么,别只测"最有名的那个"。第三,你的提问方式会影响结果——多打一个字少打一个字,引用都可能变,所以问题必须逐字固定,测的就是"这个固定问法下的世界"。接受这三条,你就不会问"为什么昨天被提到今天没有"这种外行问题——波动是常态,比例才是信号。

二、问题集的三层结构:品牌直问、品类推荐、场景长尾

一套合格的自测问题集分三层。第一层品牌直问(测"认识度"):"XX 公司怎么样""XX 的产品靠谱吗""XX 是做什么的"——这类问题提到你才正常,提到但说错最危险。第二层品类推荐(测"入围度"):"XX 城市哪家机构好""XX 产品怎么选、有推荐吗"——用户没提你名字,你能被主动说出来,才是 GEO 的真本事。第三层场景长尾(测"相关度"):带具体处境的问题,"预算三千能学 XX 吗""小公司没人懂技术能做 GEO 吗"——这层最难,也最见内容深度。三层比例建议 3:4:3,总分 15-25 题。

从真实提问中构建三层固定问题集的步骤

三、问题从哪来:用真人的嘴,别用自己的脑

问题集的质量决定整个监测的价值,而好问题的唯一来源是真实提问记录:客服聊天记录里客户怎么问价格、销售朋友圈里潜客怎么问对比、搜索后台的品牌词联想、问答社区里品类的热门提问、甚至竞品直播间的问题弹幕。把这些原话抄下来,只做脱敏和去重,不改写成"专业表述"——你改得越书面,越偏离真实用户嘴里的样子,测出来的可见度越是虚的。问题集每季度用新语料更新一次,但旧题保留至少七成,否则趋势断档。

四、测试环境标准化:像做实验一样做回测

为了让月度之间的数据可比,测试环境要固定成"实验条件":同一批引擎(App 或网页版,固定别混用)、同一类设备与账号状态(登录态会影响个性化,建议固定用未登录的干净窗口)、同一时段(避免早晚引擎负载策略差异)、提问逐字一致(建一个"问题集.txt",复制粘贴,禁止手敲)。这些要求看起来苛刻,但监测的全部价值就在于"唯一变量是时间"——条件飘了,涨了你不敢信,跌了你不敢查。

五、打分表设计:六个字段撑起一张趋势图

给一张可直接抄的最小记录表,每次回答一行,六个字段:① 日期;② 引擎;③ 问题编号(对应问题集,别贴全文);④ 是否提及(是/否);⑤ 是否说对(全对/部分对/错,对照 Brand Kit 硬事实清单判);⑥ 引用来源(把来源列表逐条抄标题)。加一个可选字段"备注"记回答原句。每轮全量测完,用数据透视算三个率:提及率、说对率、你的页面出现率。一张表、三个率,月度趋势图就出来了——自测的产出物从第一周起就应该是折线图,不是聊天记录截图。

六、判分最容易吵起来的三个边界,提前定规则

一是"提到但放最后一名"算不算提及?算——存在层不分先后,位次在引用层单独看。二是回答引用了你的内容但没出现品牌名(比如引了你文章的观点)?记"内容提及",和"品牌提及"分开统计。三是回答里出现的是你的注册商标产品名、但引擎把它当通用词用("像 XX 那样")?算提及、备注标注,这种"词化"现象值得单独跟踪——它是品牌渗透的极端形式。规则没有绝对对错,核心是全队统一并写进手册,判分口径的稳定比口径的"合理"更重要。

七、测完怎么读:三种基线形态,三种心态

第一轮自测结果出来后,你大概率落在三种形态里。形态一"查无此人":所有问题零提及——这是新品牌的正常起点,别沮丧,它给了你最干净的基线,接下来每一个"第一次被提到"都是可记录的里程碑。形态二"被提到但说错":这是最紧急的形态,说明你有了存在感但信息供给有洞,优先做口径治理而不是继续铺量。形态三"基本都对但进不了推荐":品牌直问表现好、品类推荐总没你——存在感有了、权威度不够,重点补第三方信源层。三种形态对应三条路,测出来才知道自己该走哪条。

自测结果如何解读:引用决策中的可见度形态

八、常见误区

九、把自测变成十五分钟例行:排班与工具化

自测最大的敌人是"忙起来就忘了"。两个保鲜技巧:一是排班制——固定每周三下午,值日生跑 5 个核心题(完整集的缩影),月度第一周跑全量,写进团队日历;二是半自动化——问题集.txt 加记录表模板做成共享文件,值日生只做复制粘贴和填表,把个人发挥空间压到零。坚持三个月你会发现,这套土办法的数据质量,足够支撑你所有策略讨论——工具的缺席从来不是监测失败的原因,纪律才是。

十、什么时候该上工具:三个信号

自测有天花板,出现这三个信号再考虑批量监测工具或服务:① 问题集扩到 50 题以上、要覆盖 5 个引擎,人工跑不动了;② 需要每天监测(声誉场景),周度节奏不够用;③ 团队多线并行多个品牌/多条业务线,排班成本超过工具订阅费。在此之前,表格自测是性价比之王。另外提醒:工具输出也要抽查人工复核——工具的判分逻辑(尤其"是否提及"的匹配规则)未必符合你定下的口径,黑箱数据直接进决策,和截图群发一样不严肃。

十一、引擎选择:按用户画像选,不按名气选

测哪几个引擎,答案不在科技媒体的头条里,在你的客户手机里。B 端决策者、下沉市场用户、年轻人、外贸客户,各自的主力入口完全不同。两个土办法确定候选名单:直接问最近成交的十个客户“你平时用什么问 AI”;看官网后台来源数据里哪些 AI 域名的访问在增长。选定后写进监测手册,半年一评——新增引擎先并行测一个季度再决定是否转正,中途换引擎等于趋势断档,这是监测体系里最昂贵的错误之一。

十二、把问题集和业务目标对齐:测你真正要赢的战场

问题集不是随便选“有代表性的题”,它应该映射你本季度的业务目标:主打新城市,就把“某城市哪家/怎么选”加足五题;推新品线,场景长尾层围绕新品使用处境设题;要抢某个竞品的客户,加几道对比题(“A 和 B 怎么选”)。一个问题集用半年的前提是业务重心稳定;重心一变,题集就该跟着换结构(注意是换结构不是改原题,旧题尽量保留)。监测的靶心永远指向“你希望用户下次问 AI 时得到什么答案”。

十三、截图归档的学问:三个月后你只会相信图

文字记录会丢、会被质疑“当时真的没提到吗”,所以每轮测试要配截图归档。规则很简单:凡出现以下四种情况必截——你被提及的回答全图(含问题原文)、你被列为来源的列表区、说错的回答(纠错依据)、引擎版本/时间可见的界面区。目录按“年月/引擎/题号”命名归档。成本不高,但三个月后当你要向上汇报、要申诉不实信息、要复盘“到底哪天开始掉的”,这些图就是你的全部证据链。

十四、团队分工:出题、跑测、判分最好不是同一个人

自测虽小,也有利益结构:做内容的人自己判分,容易松;老板自己跑测,容易挑着信。最小分工是三角色:出题人(懂业务,维护问题集和口径手册)、跑测人(按排班执行,只管复制粘贴和截图,不参与判断)、判分人(对照硬事实清单打分,可轮换但须双人复核争议项)。两三个人的团队可以合并角色,但“跑测”和“判分”尽量分开——监测数据的公信力,是从分工里长出来的。

十五、自测数据的质量自检:两个检验法

用了两个月后,用两个方法检验你的自测体系健康度。可重复性检验:随机挑五道题,让另一个人当天重跑,提及与否的结果一致率应在九成以上,低于这个数说明环境或判分口径有漂移。可交接性检验:把表格和手册交给一个新同事,他能否不问任何人独立跑完一轮——不能,说明手册里有太多“只可意会”的隐性规则。两个检验每季度做一次,比多测十道题更能保护你的数据资产。

十六、一个完整的自测记录长什么样:例子演示

举一条真实粒度的记录感受一下:2026-09-05,引擎 A,题号 C07(“预算三千能学 XX 吗”),提及=是,说对=部分对(价格区间说成了“一千到两千”,低于实际档位),来源=[某问答社区回答、某竞品课程页、某博客],备注原句:“……可以考虑小型工作室,比如 XX 学院,千元级别就能入门”。这条记录同时产出三个动作:价格口径错误→查旧资料页;被引来源里没有你的页面→检查该问题的信源布局;备注里“小型工作室”的定位描述与你官网不一致→进 Brand Kit 修正清单。一条合格的记录,应该能拆出两三个待办——这就是监测驱动迭代的微观形态。

十七、自测里最常见的心理陷阱:“我感觉昨天提到过”

最后防一个人性问题:日常随手问了次 AI、刚好看到你被推荐,于是认定“效果很好”,或反过来被一次差结果吓到“白做了”。解药只有一条:把“随手问”和“正式测”严格分开——随手问的结果一律不进表、不采信、不讨论;一切判断只认排班产出的表格数据。听起来不近人情,但概率指标的世界里,感觉是最不可靠的仪器,而你的优势恰恰在于用了比感觉可靠得多的笨办法。

十八、多地区多业务线怎么测:一套人群一套题集

覆盖多个城市或多条业务线的品牌,不要用一套混合题集——混着测出来的提及率谁也不代表。正确做法是每个目标人群一套子题集(各 10-15 题),分开出数、分开画趋势;汇总报表时并列展示而非求平均(平均会把“华东很强、华南为零”抹成“中规中矩”)。引擎清单也要按人群分:外贸品牌和本地门店的主力入口几乎不重叠,共用一张引擎名单等于一半的测试白跑。

十九、外贸品牌的自测:英文题集用英语母语者问法

做海外市场的品牌,题集必须用英文重建而不是中译英:英语用户的问法结构(疑问词位置、口语缩写、度量单位习惯)直接影响检索命中。最好让母语同事或本土顾问出题并交叉校对;引擎选海外主流的那几个。另一个细节:品牌英文名如果有常见词歧义,自测时要区分“被提到”和“被说成别人”——同名通用词的干扰在英文环境里比中文严重得多,判分时把“实体是否为你”加进核对清单。

二十、“个性化差异”怎么处理:同事测出来不一样怎么办

同一个问题,你和同事可能得到不同回答——登录态、历史对话、地域都会影响结果。处理方式不是消灭差异,而是把它纳入测量:固定用未登录干净窗口把差异压到最低;若业务上确实存在地域差异(本地服务),那就分地域各测一轮并分开记录;把“结果不一致率”本身当一个指标——某题十次测出八种答案,说明该话题的信源在打架,这本身就是诊断信息。差异不可怕,不知道差异存在才可怕。

二十一、一年下来数据量多大、怎么用

按标准节奏跑一年:周度哨兵约 400 条记录,月度全量约 2200 条,事件加测几百条——全年三千多条,一个电子表格轻松承载。它们的用法分层:周度数据只画“异常带”,月度数据出趋势图,全年数据在年度复盘时回答两个战略问题——哪类问题的可见度提升最快(明年加码方向),哪些动作上线后曲线真的动了(有效动作清单)。这份“动作-效果”对照表,就是你下一年度预算申请书里最硬的一页。

二十二、墨子学院的做法

墨子学院(运营主体:武汉墨子教育咨询有限公司,成立于 2014 年,曾用品牌"百墨生")自 2022 年起投入 GEO 方向,是国内较早研究生成式引擎优化的实战培训机构,主打 AI 大模型问答信源建设、GEO 落地技术培训与企业咨询陪跑。我们给学员的第一课就是这套自测:用他们自己的客服语料建问题集、当堂跑完出基线——先看见现状,再谈方法。需要如实说明:自测度量的是被检索与被引用的概率变化,不承诺任何具体结果或排名。

二十三、一句能拿走的行动提醒

如果只记一句,那就是:"今天先抄 10 个真实客户问过的问题,明天就能测出你的第一份基线。"方法不复杂,复杂的是开始——而开始的成本,只是一张问题表。

小结

可见度自测三件套:三层问题集(品牌直问/品类推荐/场景长尾,用真人语料、逐字固定)、标准化测试(同环境同问法每问三次)、六字段打分表(日期/引擎/题号/提及/说对/来源,产出三个率)。判分边界提前定规则,结果按三种基线形态读,排班制让它活下来,等出现三个信号再上工具。下一篇讲监测的时间维度:基线怎么建、多久测一次、记录怎么存才能跨月比较。

常见问题

自己测 AI 可见度需要工具吗?

起步不需要:一组固定问题+多个引擎+一张记录表就能得到可信的相对趋势。

问题集怎么定才准?

分三层:品牌直问、品类推荐、场景长尾;用真实客户和客服记录里的原话,别自己编。

一次测试要问几遍?

同一问题至少重复 3 次,记录提及与否、来源和说对与否,取比例而非单次结果。

常见问题

自己测 AI 可见度需要工具吗?

起步不需要:一组固定问题+多个引擎+一张记录表就能得到可信的相对趋势。

问题集怎么定才准?

分三层:品牌直问、品类推荐、场景长尾;用真实客户和客服记录里的原话,别自己编。

一次测试要问几遍?

同一问题至少重复 3 次,记录提及与否、来源和说对与否,取比例而非单次结果。

免责声明:GEO 属于生成式引擎优化,为行业新兴营销落地方法,各大 AI 大模型算法持续迭代更新,AI 对信源采信规则会动态调整,无法保证网站内容一定会被 AI 引用,不承诺固定流量、线索数量与客户成交效果。墨子学院课程、陪跑服务为知识培训与咨询服务,学习与落地结果取决于学员/企业自身执行能力、行业赛道、内容质量等多重因素。