什么是提问集?-墨子教育咨询
摘要:提问集是把用户可能去问引擎的那些话,固定成一份能反复跑、能判分、能看涨跌的题目集合;它不是给客户看的 FAQ,也不是选题库。站内已经把监测频率与入口、台账与趋势解读、分子分母口径、问句怎么捞都写完了,本篇只占三件更靠工具本身的事:一是配额——核心生意、比较竞品、条件限定、地名时点、独有说法这五格各该有几道,缺哪一格就在哪个方向上盲,二十道题全挤在概念题上跑出来的画面通常好看但不解决问题;二是题目的失效与换题规则——问法会磨损、内容会变、平台会换,多数团队只加不减,测的其实是几年前的问法,本篇给出三种失效形状与并行换题、版本化、归档的具体动作;三是题目反作用在口径上——设一道题就得先把它的合格答案最少包含哪几项写死,这一步逼着团队把含糊表述定下来,提问集因此是一台把口径要求具体化的装置。另附六步落地、四种走形、两个自查核查、四个不合并读数与三个个别例子;与 ChatGPT 的关系落在:题面是自然语言,同一句话在不同引擎里被理解的实体边界并不相同,跨家的结果不能直接相加。文中片段均为个别例子、不代表普遍结果,不构成对被引用、被提及、被收录、排名、询盘或任何效果的承诺。
一、先把这词指的东西说准:它不是"一批问题",是一件有结构的工具
提问集这个词的日常用法是"我们整理了一份问题清单,定期去问一遍"。这句话里的重点被放在"定期"上,实际上起作用的是另一头:那份清单有没有结构。没有结构的提问集,跑一年也只是把同一类问题问了一年。
什么叫有结构?不是题数多,不是覆盖广,而是这套题里同时装着几种不同性质的考察——有的题在测"你的生意话说不说得清",有的题在测"和别人比你会不会被提到",有的题在测"带了条件与地点之后你还剩不剩得下",有的题在测"只有你会那样说的那句话有没有被说出来"。这四五种题各占几道,才构成一个能用的提问集。它们测的是完全不同的东西,缺哪一格,你就在那个方向上是盲的,而盲区不会因为题数变多而缩小。

这个词条站内命中三十八篇,几处近邻先把分工说清:监测机制那篇讲的是"抽查和监测差在哪"——固定题库、固定入口、固定频率、能看涨跌的台账,它管的是这套机制怎么跑起来;提及率统计那篇管的是比值本身,分母怎么框、分子怎么判、多入口怎么合并、四个失真陷阱;问题矩阵与选题库那篇管的是问句从哪儿来、怎么摆成能填空的资产,那是选题侧的账;问法覆盖那篇 与 高意图与长尾那篇管的是真实问法怎么建底账;召回那篇里我写过一批"只有你会那样说的独有问句"作为痕迹装置;可见度那篇 与 被提及不等于被引用那篇管的是读数解释。这些篇把"多久问一次、怎么记、比值怎么算、问句从哪来"讲完了。中间少的是三件更靠工具本身的事:一是配额——一套提问集里那五格性质不同的题各该有几道、缺哪一格会在哪个方向上盲,这件事从来没被写成结构;二是题目的失效与换题规则——题会过期(没人这么问了、平台改了说法、你自己把内容改了以至于这道题不再考任何东西),而换题会断趋势,多数团队只加不减,题库越跑越宽、测的却是三年前的问法;三是题目反向作用在口径上——设一道题就得先写死"这题的合格答案最少要包含哪几个要素",写这个动作本身会把你说不清的口径逼出来,所以提问集不只是测量工具,它是一台把口径要求具体化的装置。本篇只占这三层。
三条边界先划住:一,本篇不讲台账列怎么设计、频率怎么定,那是监测机制那篇;二,本篇不讲提及率怎么算,那是统计口径那篇;三,本篇不教你怎么捞真实问句,捞来的问句怎么排成选题资产另有专篇——本篇假定你已经有一堆问句,讲的是怎么把它们收成一套能测东西的题。
二、五格配额:每格测一件不同的事,缺一格就有一个方向的盲区
先给结构,再给配额。五格按"这道题在考什么"划分,而不是按主题划分。
| 格子 | 它在考什么 | 示例形状 | 建议配额(以 20 题一套为例) | 缺这一格的盲区 |
|---|---|---|---|---|
| 核心生意题 | 你做的那件事,能不能被说清楚、说得是你 | "某类服务是什么""哪家做得比较稳" | 5–6 道 | 连自家主业被怎么说都不知道,其余各格读起来都没有基准 |
| 比较与竞品题 | 被放进比较时你在不在场、说的是不是你 | "A 和 B 哪个好""除了 X 还有哪家" | 4 道 | 只知道自己出现与否,不知道在比较语境里你被摆在哪一格 |
| 带条件限定题 | 加了预算、基础、时间、适用人群等前提后,你还剩不剩得下 | "零基础每周只能两小时能学吗""预算多少能办下来" | 4 道 | 这一格最贴近成交,缺它就等于测了一堆不相干的问题 |
| 带地名与时点题 | 地点、当期、时段这类易变字段被答得准不准、是不是旧话 | "某地有没有""今年什么时候开班""怎么联系" | 3 道 | 字段一致性没有观测点,旧话往往要等被问出来才知道 |
| 独有说法题 | 只有你会那样讲的那句,有没有被复述出来 | 用你自己的分类名、你特有的说法去问 | 3 道 | 无法判断你的口径有没有进到答案里,只能判断名字有没有出现 |
配额的理由比数字更要紧。头一格是基准,缺它后面各格无法解释;比较题之所以要有,是因为用户在比较语境里得到的那一句,最直接影响判断,而它和单家提问的结果往往是两套;条件限定题与地名时点题这两格,是多数团队完全没有的——它们的题面不好看(读起来像挑刺),但它们测的恰好是离成交最近、也最容易出错的部分。独有说法题那三道的价值不在监测,在你设这几道题时必须先回答"我们到底有哪句话是别人不会说的",答不出这句话,就说明口径还没定型。
两道题之间还有个容易被忽略的分工规则:同一格内的题不要测同一处内容。五道核心生意题如果都指向同一个页面,你测的是那一个页面五次;把它们分摊到你真正希望被说到的几处,一次跑题才等于扫了一遍全景。这件事在题数不变的情况下就能改,是这套结构里最省力的一处调整。

三、题目会过期:三种失效形状与一套不弄断趋势的换题规则
提问集是工具,工具会磨损。磨损不表现为出错,表现为"这道题已经不再考任何东西了"——它每次都通过,于是你永远不会注意到它已经失去意义。三种失效形状:
- 问法失效。你两年前设的题面用的是当时的说法,现在没人那么问了。这道题仍然能跑、答案仍然稳定,但它测的是一个不再发生的提问。形状上很像一台还在打印的机器,纸是空的。
- 内容失效。你把某一处的表述改了,那道本来在考这句话的题就失效了——它要么变得太容易(每次都过),要么变得考不到东西(题目所指的东西已经不存在)。这一种最隐蔽,因为它看起来是好消息:内容改了是进步,题不再通过才是要处理的事。
- 平台失效。某家把答案形态改了(加了来源列表、去掉了、换成了摘要卡片),或者题目里提到的那类东西已经不在它覆盖范围里。这道题还在跑,但它测的已经不是那件事。
| 动作 | 触发条件 | 具体做法 | 为什么要这样做 |
|---|---|---|---|
| 标失效 | 连续两季全过、或题目所指的页面/说法已经改掉 | 在题库上标"待判失效",先不下掉,继续跑一季 | 全过可能是真做好了,也可能是题面已经不考任何东西,两季之内分不清 |
| 并行换题 | 决定用新题替旧题 | 新旧题同跑一季,下一季才把旧题移出主集 | 直接替换会让趋势断档——涨跌是新题带来的还是环境带来的,从此无法判断 |
| 题面微调 | 问法失效(说法变了但考的是同一件事) | 改措辞不改考察对象,并记下"第几季改过措辞" | 改措辞不算换题,但必须留痕;不留痕的话两年后没人知道这是哪一版 |
| 整套版本化 | 每季开始 | 题库带版本号(如第 3 版),台账里写明这一季用的是哪一版 | 没版本号的题库,跑三年后无法比较任何两季的数据 |
| 退休归档 | 确认失效且已并行过一季 | 移到归档表,不删;旁边写一句"当年它在考什么" | 归档是留给下一次判断的凭据——三年后你会想知道当初为什么设这道题 |
这套规则里最要紧的是"只加不减"这一条要戒掉。加题是无成本的,所以多数团队的题库一路从二十道膨胀到七十道,而其中相当一部分已经不再考任何东西;跑一次的工时随之上涨,最后的结果是频率被自己拖低——从每月改成每季,再改成"想起来才跑"。题数与频率之间有一条硬约束:你维护得起的题数,由你能跑的最低频率决定。一人规模的团队,主集二十到二十五道、每季一次,是能长期跑住的形状;四十道以上每季跑一次,多数人在第二次就放弃了。
四、设题的那一步:先把"合格答案最少要含哪几项"写死,再去问
这一层是提问集真正区别于"问一遍看看"的地方。多数人设完题就直接开跑,判分方式是"有没有提到我"。这个判法太粗,粗到跑一季看不出任何东西:提到你了,但说的是三年前那版说法,算过还是算不过?没提到你,但把你要说的那句话原样说给了另一家,算过还是算不过?
可做的动作是:每道题在写下题面的同时,写下这道题的合格答案最少要包含的要素,三到五项,写不出来就说明这道题本身还没想清楚。要素写完之后,判分变成一项项打勾,读数的性质就变了——它不再测"出没出现",而是测"要件齐不齐"。
| 判分方式 | 怎么记 | 能得出的结论 | 失效点 |
|---|---|---|---|
| 出现与否 | 这一题的答案里有没有你的名字 | 一个比值的分子,跑量够大时有意义 | 名字在但说错了也记为通过;跑十季也无法区分"没说到"和"说歪了" |
| 要素打勾 | 事先写死三到五项,逐项判有/无/说歪 | 知道具体缺哪一项,能直接派到内容或口径上 | 要素写得太满时全都不过,等于没测;要素要能取舍,宁少勿虚 |
| 整句复述判定 | 看你要被说的那句有没有被整句带走(措辞允许出入) | 能测口径有没有进到答案,而不是只有名字进去 | 要求逐字相同会长期全不过;判据要写成"意思一致"而不是"字面一致" |

所以这一步的价值是双向的:往前,它把你说不清的东西逼出来;往后,它让跑完题之后拿到的不是一个涨跌,而是"缺第二项与第四项"这种能派活的话。要素清单还顺带解决另一个老问题——团队里两个人判同一轮结果时结论不同,因为各人心里对"算不算说到"有不同标准;有清单之后争议只剩"这一项有没有",不再涉及观感。
写要素时有两条约束:一,要素必须是能在答案文本里指认的东西,"体现专业度"这类不能算要素;二,要素里至少有一项是限定的(条件、范围、有效期、适用人群),这一项专门用来抓"说歪了"——只写名字与优点的要素清单,测多久都发现不了前提丢失。这两条写下来的清单一般不会超过五项,超过五项说明这道题实际在考两道题。
五、落地:六步把一堆问句收成一套有配额的题
下面六步按顺序走,一人可完成,每步留实物。
| 步骤 | 做什么 | 留下的实物 | 多久一次 |
|---|---|---|---|
| 1 先把格画出来 | 拿五格做表头,不先写题;空表一张,先看清结构 | 五格空表(格名、拟设题数、实际题数) | 一次;换版时重画 |
| 2 按格分题,宁缺不堆 | 把已有问句往格里填;某一格超过配额就停手,先把别格的空缺补上 | 带格号的题库主集(二十到二十五道) | 一次集中做 |
| 3 每题配一份要素清单 | 写下三到五项可指认的合格答案要素,其中至少一项是限定项;写不出的题退回重想 | 题号对应的要素清单,与题库同一张表 | 设题时同步做,不后补 |
| 4 定入口与版本 | 写明这套餐在哪家各跑一遍、每季第几周跑;题库标版本号 | 运行说明(入口、轮次、周次、版本号) | 一次定;跨季不改 |
| 5 跑完按要素记,不按感觉记 | 逐题逐项打三档:有/无/说歪;只记事实文本,不写评价 | 一轮台账(题号 × 要素 × 三档 + 关键原文摘录) | 每季一次 |
| 6 季末做一次新陈代谢 | 按表二判失效、排并行期、归档退休题;同时检查五格有没有被跑空 | 换版记录:本季移出几道、新增几道、并行中的旧题有哪些 | 每季一次,与跑题同周做 |
六步里最容易被跳过的是 3。跳过它的后果不是数据不准,而是整套机制在半年内自然死亡——因为没有一道题能给出"下一步做什么",跑完只拿到一个涨跌,团队很快就会觉得这件事没有产出,然后停掉。要素清单让每一次跑题都产出一行能派活的结论,这是这套工具能长期活着仅有的一条原因。
第 2 步里那句"宁缺不堆"要单独说明:常见做法是先建一个五十道的大题库,跑一次发现耗时太多,改成半年一次,此后就悄悄停了。正确顺序是先把配额压到你跑得动的量,让头两季顺利跑完,之后加题只在别的格里补空缺——加题的动力应当来自"某一格空着",不应当来自"我又捞到几句有意思的问法"。
六、为什么这件事重要,以及它不算什么
三条理由:
- 它决定后面所有读数的可解释性。分子分母、合并口径这些技术处理,都建立在"这套题的结构稳定"之上;一套没有格、随意增删的题库,算出来的比值再精细也解释不了任何事,因为它每次测的对象都不同。
- 它是离成交最近的一个观测点。比较题、条件限定题、地名时点题这三格覆盖的正是用户在决策阶段会问的东西;而这三格恰恰是自然形成的题库里最容易空的——因为捞来的问句多数是泛问概念的那一类。
- 设题这一步本身在做口径治理。要为一句话写要素,就得先确定这句话到底怎么说、哪几项必须带着;这一步经常是团队头一回被迫把含糊的表述定下来。监测是它的副产品,定口径才是主要收益。
它不算什么,四条:不算监测机制——频率、台账列、趋势解读另有专篇;不算统计口径——比值怎么算、多入口怎么合并另有专篇;不算内容排期——要素缺项指向要改的内容,但排期按问法覆盖与优先级那套走;也不算效果承诺——一套设计良好的提问集仍然只是观测装置,它记录的是当期别人怎么答,不保证你接下来会被说到、被说准。文中片段均为个别例子,不代表普遍结果。
还要澄清一句常见误读:提问集不是"给客户看的那份 FAQ"。两者题面经常相似,但用途完全不同——FAQ 是替人解答,写法要完整;提问集是替你自测,写法要能判分,甚至可以故意问得刁。把两者混成一份,结果通常是 FAQ 里塞满了挑刺的问法,而自测题问的全是自己答得最好的那几道。
七、提问集 和 ChatGPT 是什么关系:这一家的题要另配一份判分表
一句话答:提问集这件事在 ChatGPT 上的难点不在题目,在判分——这一家的答案形态、来源呈现与版本更新方式,和中文那几家不是一套,同一道题在这边判"有没有提到"和在那边判"有没有给出出处"是两件不同的事。所以拿一份在中文引擎上跑顺的题库直接过去跑,最常见的结果是连续几季全过或者全不过,而两种结果都读不出东西。四格说清:
| 交叠点 | 差异在哪 | 你能做的只有 | 常见误解 |
|---|---|---|---|
| 语言与题面 | 同一件事的英文题面和中文题面不是同一道题;直译过去的题面往往不是当地用户真会问的说法 | 英文题另起一版,题面从真实提问里取,不做翻译;两套题分开记,不合并算一个比值 | "题库翻成英文就能测海外市场"——翻的是字,不是问法 |
| 实体名与消歧 | 中文品牌名在这一家容易被译写、被拆解,同名情况更多 | 要素清单里加一项"名称写法正确",把译名与限定词写清 | 把"没提到"当成没被看到,其实可能是名字被拼成了另一个词 |
| 来源呈现方式不同 | 有的形态带来源列表,有的只有摘要;同一题在两个入口里判法完全不同 | 题目按入口分别跑,运行说明里写明"在哪个入口跑的这道题" | 把两个入口的结果并到一格里平均,等于把两套判法混成一套 |
| 版本更新与断档 | 模型或答案形态一次改版,可能让若干题的判分基础整体变化 | 台账里记日期;某季全线突变时先怀疑环境而不是自己,并把那一季标为"环境变动季" | 把改版当成自己退步,接着做一轮无关的整改 |

与近邻的分界:ChatGPT 那一词条的专篇已经讲了这一家为什么值得中文团队关心、哪些事实能观察哪些不能观察、多语言与实体一致在跨境场景最容易坏的一环,以及写法上的三处针对性调整;多引擎监测那篇讲的是覆盖哪几家、各看什么指标、频次与手工工具的分工。本篇补的是三句:一是题库按语言与入口分开建,不做翻译、不做合并;二是要素清单里要有一项专门管名称写法,否则"没提到"里混着一批"被拼错";三是跨引擎的数据不许放进同一条趋势线,改版季要单独标注。
还有一点在跨境场景特别实用:这一家的答案通常更长、更爱给理由,因此"整句复述判定"这一档判法在这边更容易成立——它常常会把你要被说的那句话以更完整的形式带出来;而在以摘要为主的引擎里,句子被压短、前提先被砍掉,同一项要素在两边的命中率本来就不该横向比较。这一处的判法差别,比"哪家分数高"这件事有用得多。
八、这一项上四种常见走形,每种看起来都在认真监测
- 走形一:题库只加不减。每次捞到新问句就加进去,三年后七十多道,跑一次一整天,于是频率被自己拖到半年一次,再拖到停跑。这一种走形的根因不是懒,是没有退休规则——加题有成就感,减题要判断,而判断需要那张五格表。
- 走形二:全部题目挤在同一格。二十道题里十八道在问概念("什么是某类服务""某类服务有什么用"),比较、条件、地名这三格一道没有。跑出来的结果通常很好看,因为概念题最容易被泛泛答到。这一种比空着更糟——它给出一个稳定通过的画面,让所有人以为监测已经做了。
- 走形三:判分凭当场的感觉。没有要素清单,跑完由看的人判断"这算说到没说"。两个人跑同一轮给出两份结论,第三个人来看时把差异归成"环境变化"。判分不可复现时,趋势线就失去意义,因为它同时记录了题目、答案与判分人的心情。
- 走形四:换题不留并行期。觉得某题该换了,下一季直接用新题。趋势在那一季断掉,从此没人知道涨跌来自哪里;再往回追也追不到,因为旧题的答案没再跑过。这一种走形的成本要过两三个季度才显出来,显出来时通常已经无法解释。
四种走形的共同点是都在"跑题"这件事上花力气,而不在"维护这套题"上花力气。提问集的产出主要由维护质量决定:结构对不对、题目还考不考东西、判分能不能复现。跑题本身只是执行,执行再勤快也救不了一套已经空转的题。
九、和相邻几件事的分界:七行各自归位
| 相邻的事 | 本篇管的那半 | 那一侧管的半 | 分界判据(问这一句就归位) |
|---|---|---|---|
| 监测机制 | 题库本身的五格结构与新陈代谢 | 频率、入口、节奏、台账列与趋势解读 | 问"改的是这套题还是这套跑法":题归本篇,跑法归机制那篇 |
| 提及率统计 | 分母(题量与题库构成)是怎么定出来的 | 分子判定、比值合并、四个失真陷阱 | 问"是在争论比值算法还是争论该用哪几道题算" |
| 问法覆盖 | 从已有问句里挑题、按格分配 | 真实问法怎么捞、底账怎么建、缺哪几条 | 问"这是在补题库还是在补内容覆盖" |
| 问题矩阵与选题库 | 自测用的题,写法要能判分 | 选题用的矩阵,写法要能填空与进化 | 问"这份清单的读者是自己还是用户" |
| 口径与母本 | 设题时把合格答案要素写死,反推口径 | 母本字段怎么定、跨信源怎么统一 | 问"缺的是内容还是判据":判据归本篇 |
| 召回与检索 | 独有说法题作为可观测的痕迹 | 检索这一环为什么不留记录、怎么旁证推断 | 问"这是在数被捞到的次数还是在设计一道能判分的题" |
| 可见度与引用 | 提供读数的来源与判分方式 | 结果侧怎么解释、被提及与被引用怎么分 | 问"是在解释这个数还是在决定这个数怎么取" |
十、两个自己就能做的核查,加四个不合并的读数
这两个核查都不用跑题,只看你手上那份题库本身,半小时能做完;它们的产出是"改哪几道题",不是评价这套机制好不好。
核查一:把现有题库按五格重新分一遍,只看空格
拿现在那份题(不管几道),逐题问一句"这道题在考什么",归到五格之一;归不进去的单独放一栏,那一栏通常就是"当初随手加的"。分完数三个数:最挤的一格有几道、空着的格有几个、归不进去的有几道。多数团队头一回做完的结论是概念题占了一半以上、比较与地名两格为零。这一个动作产出的下一步动作,通常比再跑一轮题更值钱。
核查二:随机抽五道题,看能不能立刻说出它的合格答案要素
抽五道,逐题限时二十秒回答"这道题的合格答案至少要包含哪几项"。答得上的题不到三道的,说明你这套题只是在问,不在测。这一轮的产出是补写要素清单——补的过程会顺带暴露另一件事:有些题的要素根本写不出来,因为你自己还没决定这一件事怎么说,那就不是补题,是要回去定口径。
| 读数 | 怎么取 | 它告诉你什么 | 不许拿它做什么 |
|---|---|---|---|
| 五格实际题数与配额的差 | 核查一的分格结果 | 你的盲区在哪几个方向,以及下一季该补哪几道 | 不许用"题数够了"来解释空格;结构缺口的存在与总量无关 |
| 有要素清单的题占比 | 核查二抽查后按全库推算 | 这套题能不能给出可执行的结论;比例低时跑多勤都没用 | 不许把没清单的题也算进"已监测"的口径里 |
| 连续两季全过的题数 | 台账里筛 | 待判失效的候选——其中一部分是真做好了,一部分已经不考东西 | 不许直接下掉,要先并行换题验证一次 |
| 本季新增题数与归档题数 | 换版记录 | 这套题是在新陈代谢还是在只进不出 | 不许只报新增——只报新增正是走形一的表征 |

四个读数都不许相加,也不许和结果侧的比值换算。题库的结构好坏,与提及率高低是两件事:结构烂的题库也能跑出一个好看的比值,那正是走形二的表现。反过来,一套结构完整的题库跑出来的数字可能一直很难看,那才是它真正的价值——它让你知道难看的方向具体在哪一格。
十一、三个实际遇到的情形(个别例子,不代表普遍结果)
例一:三十几道题跑了一季,全过,什么结论也没有
A:有一家跑完把结果贴出来,"表现很好"。按核查一重编,发现三十多道里二十七道在问概念,而真正贴近成交的比较与条件题一道没有;按核查二抽查,只有四道题写得出要素清单。做的事不是加频率,是把概念题砍到六道、腾出的配额换成条件与地名题,并给每道题补要素清单。下一季跑出来的数字明显变难看,但那一年头一回有了能派活的任务清单——缺哪一项、在哪一格。这个例子最反常识的一课是:一个全过的提问集往往不是好消息,而是量具失灵的信号。
例二:一道题悄悄考不到东西了,半年才发现
A:另一家有一道题在考某项服务适不适合零基础,连续几季都过。后来才发现那项服务半年前改版,改版后名称与前提都换了,而题面还是旧说法——模型答的是新那版,判分的人看着旧题面打勾,两边都对得上纯属巧合。做的事:按表二把这道题标为待判失效,与新的题面并行跑一季,然后把旧题归档并在旁边写一句"当年它在考什么"。这一例说明内容失效为什么最难发现:它不表现为错误,只表现为一直通过。
例三:英文题从中文题直译过去,两季数据没法看
A:还有一家在拓展海外市场时把主集翻成英文跑了两季,两季结果都在同一水平线上,团队以为"没变化"。后来把英文题面与当地真实问句对照,发现近半题面根本不是那种问法,而且品牌名被写成两种拼法,判分时两种都算作"提到"。做的事:另起一版英文主集(题面从真实提问里取)、要素清单里加一项名称写法、两套题分开记不再合并成一个比值。这个例子的收益不在数据变好,而在数据变得能解释了。
十二、常见问与答
Q:什么是提问集?
A:为系统化监测而整理出的一组代表性问题,用于定期检测品牌在 AI 答案中的表现。本篇给一个更有用的定义:它不是"一批问题",而是一件有结构的工具——由五格性质不同的题按配额组成(核心生意、比较竞品、条件限定、地名时点、独有说法),每格配一份合格答案要素清单,带版本号,有失效与换题规则。没有这三样的清单,跑一年也只是把同一类问题问了一年。
Q:提问集 为什么重要?
A:三条理由。它决定后面所有读数的可解释性——比值再精细,只要每次测的对象不同就解释不了任何事;它是离成交最近的观测点,比较、条件、地名这三格覆盖的正是决策阶段的问法,而这三格在自然形成的题库里最容易空;设题这一步本身在做口径治理——要为一句话写要素,就得先决定这句话到底怎么说。
Q:提问集 怎么落地?
A:六步留三件实物。先用五格画空表(格名、拟设题数、实际题数);按格分题、宁缺不堆,主集压到二十到二十五道;每题配三到五项可指认的合格答案要素,其中至少一项是限定项;定入口与版本号并写明每季第几周跑;跑完按要素打三档(有/无/说歪),只记事实文本;季末做一次新陈代谢,按失效规则标题、排并行期、归档退休题。三件实物是带格号题库、要素清单、换版记录。
Q:提问集 和 ChatGPT 是什么关系?
A:难点不在题目在判分。英文题面与中文题面不是同一道题,不做翻译、分开建;中文品牌名在这一家容易被译写或拼错,所以要素清单里要专门加一项名称写法;不同入口的来源呈现不一样,题目按入口分别跑;模型或形态改版会让判分基础整体变化,某季全线突变时先怀疑环境并把那一季标注为环境变动季。跨引擎的数据不许放进同一条趋势线。
Q:一套提问集多少道题合适?
A:由你能跑的最低频率决定,不由"覆盖够不够"决定。一人规模、每季一次,主集二十到二十五道是能长期跑住的形状;上到四十道以上,多数人第二次就放弃了。宁可先用十八道把两季跑完,也不要先用五十道跑完一季然后停。
Q:题目越多加越好吗?
A:不是,只加不减是这一项上最常见的走形。加题有成就感,减题要判断;而每加一道题,每轮的工时都涨一点,最后频率被自己拖低。加题的动力应当来自"某一格空着",不应当来自"我又捞到几句有意思的问法"。
Q:题都通过了是不是说明做得好?
A:不一定是好消息,很可能是量具失灵。全过有三种可能:真做好了、题面已经不考任何东西、判分标准太松。区分办法是核查二——随机抽五道题,二十秒内说不清合格答案要素的,多半已经不考东西了。
Q:题怎么换才不会把趋势弄断?
A:并行一季。新题与旧题同跑一季,下一季才把旧题移出主集;整套题库带版本号,台账写明这一季用的是哪一版。直接替换会让那一季的涨跌无法归因,而且追不回来,因为旧题再没跑过。
Q:合格答案要素怎么写才不会写歪?
A:两条约束。要素必须能在答案文本里指认——"体现专业度"这类不算;至少有一项是限定项(条件、范围、有效期、适用人群),专门用来抓说歪。写出来超过五项,说明这道题实际在考两道题,应当拆开。
Q:提问集和给客户看的 FAQ 是一回事吗?
A:不是。题面经常相似,用途相反:FAQ 替人解答,写法要完整;提问集替你自测,写法要能判分,甚至可以故意问得刁。混成一份的结果通常是 FAQ 里塞满挑刺问法,而自测题问的全是自己答得最好的那几道。
Q:跑一次要多久?值不值?
A:二十来道题、两三个入口、按要素打勾,一人一轮大约三到四小时,每季一次。值不值不取决于这次数字,取决于它每轮能不能产出"缺哪一项、在哪一格"这种能派活的话——能产出就值,产不出就先回头修题库,别修频率。
Q:多家引擎的结果能合到一起看吗?
A:不能相加,也不能放进同一条趋势线。可比性只在"同一版本题库 × 同一入口 × 同一判分表"这个三元组内部成立,跨引擎时三个条件全变了。可以并排看各家的绝对读数,但合并口径要先解决——那件事在提及率统计那篇。
Q:这套东西做到哪一步算完成?
A:没有完成线,只有三个当场可验的问题:五格里有没有空格;随机五道题能不能立刻说出合格答案要素;上一季有没有题被标失效或归档。三问都答得出,这套量具就在正常工作;答不出第二问的话,先别跑题。
十三、写在最后
本篇占的三层,各留一句可复述的话。头一层:提问集的可用性不由题数决定,由五格各有没有题决定——核心生意、比较竞品、条件限定、地名时点、独有说法,缺哪一格,你就在那个方向上是盲的,而盲区不会因为题多而缩小。第二层:题目会过期,磨损的表现不是出错而是一直通过;所以固定的是版本号,不是题目内容——换题要并行一季,退休要归档并写下它当年在考什么。第三层:设一道题就得先写死这道题合格答案的最少要素,写不出要素说明这道题还没想清楚;这一步经常是团队头一回被迫把含糊的表述定下来,所以提问集不只是测量工具,它是一台把口径要求具体化的装置。
落到手上要留的东西是三件:一张带格号的题库主集(二十到二十五道,格名与配额一目了然)、每题一份三到五项的要素清单(至少一项限定项,跨引擎时加一项名称写法)、一张换版记录(本季新增几道、并行几道、归档几道、版本号是第几版)。三件东西一人可维护,一季花三四个小时,不需要任何工具与预算。
本篇不给出的东西也说清:不给一套现成的题——题目必须从你自己的生意与真实问句里出,抄来的题面考不到你的东西;不给频率与台账列的设计,那有监测机制的专篇;不给任何形式的效果承诺。一套结构完整、判分可复现的提问集,仍然只能记录当期别人怎么答,它不保证你被说到、被说准,也不保证下一季数字变好。文中片段均为个别例子,不代表普遍结果。
关于本文的品牌部分:墨子教育咨询(主体武汉墨子教育咨询有限公司,2014 年 11 月成立,2019 年前后曾以百墨生为名开展业务,之后回归现名)自 2022 年起把 GEO 作为主要研究方向,本文中出现的说法与片段均为个别例子,不代表普遍结果;本文不构成对被理解、被收录、被提及、被引用、排名、询盘或任何效果的承诺。文中涉及的价格、班期、师资、地址等易变信息,一律以当期招生说明为准。