什么是相关性?-墨子教育咨询
摘要:相关性指检索结果与用户查询在语义上的匹配程度,是决定内容能否被召回并进一步被 AI 答案采用的核心判断维度。站内把外部怎么算相近、门槛在哪一格、怎么写更容易被摘都写过了,本篇只占管理侧的一层:相关性该记在哪一格上。它不挂在页面上,挂在某一句问话与某一段文字这一对上;按页面记会长出两种批量返工——一页塞十个问法,或者一个问法开十页。核心实物是一张二十到四十行的配对账:原句、这句里的限定、只许填一个位置的主答段、限定有没有写进那一段、盖住问句读这段、盖住这段读那句问话;六步走完(捞当期原句、圈限定、定主答、反着核两遍、按上限决定合并补还是暂不覆盖、每季重跑)。相关还有上限:一段文字只贴着一句问话写,同一主题的其他问法就从它这里取不到东西。它与收录的关系:收录决定在不在场,相关决定在场之后会不会被拿去答这一句,四种组合各修一侧。文中片段均为个别例子、不代表普遍结果,不构成对被召回、被收录、被提及、被引用或任何效果的承诺。
一、先把范围圈出来:相关性 指什么,本篇与站内那十几篇怎么分
百科页给的口径是:相关性指检索结果与用户查询在语义上的匹配程度,是决定内容能否被召回并进一步被 AI 答案采用的核心判断维度。这句话在实践里被读成"要提高页面相关性",于是出现了第三节的批量返工——因为"页面"这一级上其实没有相关性可提:被判相关的从来不是整页,而是某一段文字与某一句问话之间的那一对关系。
这一族站内写得极密,先摊开,本篇不重复它们。外部怎么算那一侧:《用户怎么问、AI 怎么找:GEO 里的分词与语义匹配机制》把字面匹配与语义匹配的差别、系统怎么认出"你说的和问的是同一件事"、三类最常见的错位、把内容翻译到用户语言的三层做法都写完了;向量与语义匹配那篇把坐标、相似度怎么算、以及"不必押原词但要押意思"讲透,第五节还专门点破了同义词堆叠不是语义匹配;重排序那篇管召回一堆之后凭什么把你排到前面,上下文组装那篇管从召回到排序再到裁剪那一段,查询理解与意图改写那篇管一句话被改写之后答案为什么会变、以及"一种问法扩成一片问法"这条内容侧打法;语义匹配、实体关联与知识图谱那篇与大模型怎么决定引用谁那篇各管认识你这一侧;《什么是RAG?》把问句变检索、取料、拼装、生成四段过程摆开。
门槛与通道那一侧:内容被 Bing 收录了为什么 Copilot 还是读不到那篇讲候选窗口这道门槛——被收录不等于被读到,取料只发生在检索窗口前排的少数候选里;百度 AI 搜索答案卡那篇把召回、选材、生成引用三道闸分开;豆包逐轮重检索与引用漂移那篇讲改写、候选、拼装三层变量;DeepSeek 对比类问题的候选占位那篇与它到底会引用哪些来源那篇管一家的候选名单。
页面与写法那一侧:标题与开头怎么写那篇讲标题决定能不能进检索候选、前几行决定答案会不会被直接摘走;《结构化内容怎么做》那篇与一篇 GEO 友好文章的标准结构那篇管形态,中文可摘写作法那篇与一段一问、带边界的问答写作法那篇管句与段;容易被大模型采信的六个特征那篇管可采信这一侧,《什么是采信?》管从被检索走向被引用那一环。
问法与说法那一侧:《口语化提问怎么落地:原话从哪捞、写进正文哪三处》管原话从哪来、写进哪三处,真实提问变体覆盖那篇管变体铺在标题、小标题与问答的哪几处,长尾问句改写那篇管把残缺词补成完整提问,移动和语音正在改写提问方式那篇与豆包语音场景那篇管入口形状,《什么是口语化?》管改写时的四条不可改。
链路上相邻词条另有 《什么是抓取?》、《什么是收录?》(其中"没被收录的四种真实含义"那一节与本篇第六节直接相接)、《什么是可抓取?》、《什么是网站技术适配?》、《什么是机器可读?》;本系列里 《什么是决策问题?》 管题与题的先后,《什么是固定题集?》 管量变化的尺,《什么是提及率?》 管比值。工具与实体一侧还有 技术类体检工具那篇 与 把你和别家搞混那篇。
这些篇目把"外面怎么算相近、门槛在哪一格、怎么写更容易被摘、被选凭什么"都讲完了。中间少的是一件很管理侧的事:相关性这件事该记在哪一格上。多数机构把它记在页面上——给页面打一个相关性分、给整页提一次相关性,于是出现一批在一页里塞进十个问法、或者反过来给每个问法各开一页的动作。本篇只占这一层:判定单位、一张问句与段落的配对账、以及相关的上限(过度贴合单一问法的四种实际代价)。外部机制与写法一律指路,本篇不复述。
三条边界。头一条,本篇不讲匹配怎么算——向量、相似度、重排序那些在 向量那篇 与 重排序那篇 里,本篇要用的是它们的结论而不是原理。第二条,"提升相关性"在本篇不是一个动作,最多是配对账补齐之后的副产品;谁要是把相关性当成一个页面分数去优化,本篇的动作反而会被他省掉。第三条,相关不带来任何结果说法:它只描述一句问话与一段文字之间的关系对不对得上,判的那一方不是你;本文所有动作不构成对被召回、被选取、被提及、被引用或任何效果的承诺。

二、单位错了才会长出两种批量返工
相关性被记在页面这一级上,最典型的产出是两种做法:一页尽量多答,或者一题尽量多页。两者的动机都是好的——多答就覆盖广,多页就写得细——但它们来自同一个误判,且代价形状不同。
| 做法 | 看起来的好处 | 按配对关系看实际发生的事 | 多久会暴露 |
|---|---|---|---|
| 一页答十题 | 省工、内链少、页面看起来厚 | 每一题都只拿到这页里的三分之一段;限定条件为了节省篇幅被合并成一句"具体视情况",于是十道题各有一处答半所问。页面分数看着很高,配对账上十行全没过关 | 很快——被问到之后对方追问第二句时就会发现那一格是空的 |
| 十页答一题 | 每页都能写得很细、看似把一题做透 | 取料时只会拿走其中一页,另外九页的限定与例外拿不到;同一题的口径分裂成十份,改一次条件要改十处,改不全就是矛盾。相关性没提高,维护成本先提高了 | 慢——要到头一回改版或者头一回政策调整时才暴露 |
| 给整页提相关性 | 立项方便、能写进季度计划 | 动作落在页面上(加长、补图、重写导语),但没有一行动在"哪一句问话由哪一段答"这一对上;做完之后配对账一格没变 | 要看下一次回测才知道,而回测的题目往往又不是那一句 |
这张表里第三种最麻烦,因为它看起来像在工作。判断一个动作是不是真在管相关性,只用问一句:改完之后,配对账上有哪一行的哪一格变了?如果答案是"整页更完整了",那这个动作属于别的层——多半是 可采信那六个特征 里厚度那一侧,或者形态层的活,它不该记在相关性账上。
把单位从页面换成"一问一答这一对",还有一个立刻可见的好处:它让相关性与质量脱钩。一段答得很好的文字,对某一句问话可能就是不相干;反过来一段被编辑嫌太短的句子,可能正好是那一问需要的那一句。这就是为什么按页打分时,机构会反复把"质量不够"当成"相关性不够"来修,写了三千字去补一道本来只差一句条件的题。《什么是信息密度?》 讲一句里的有效成分占比,本篇讲的是这一句该出现在哪一段、去答哪一问,两件事不能互相替代。
三、配对账:为相关性只该建的那一张表
本节给本篇的核心实物。它很朴素:一行一道问句,六列,纸质表格也能画。它的价值在于头一回把"我们的内容相关性不行"这句话变成可指认的某一行某一格。
| 列 | 填什么 | 为什么非要有这一列 |
|---|---|---|
| 原句 | 逐字抄来的用户问法,不改通顺、不合并、不美化;来源与日期标在旁边 | 改写过的问句已经不是被人问的那一句;采集口径在 原话那篇 里已定,本篇直接沿用 |
| 这句里的限定 | 把句子里的收窄成分圈出来:时间、地点、对象、数量、条件("周末""就近""两万以内""零基础") | 相关性失手绝大多数落在限定上而不是主题上——主题对上了、限定丢了,就是答得过泛 |
| 主答段在哪一页哪一节 | 只允许填一个位置;填不出就写"无主答" | 一题只记一个主答,十页里挑一页当主答,其余写"补充";这是防止摊薄的那一列 |
| 那段里有没有把限定写进去 | 只有是与否;写"是"的条件是限定那几个字出现在这一段之内,而不是出现在同页别处 | 被摘出去、被念出来的往往就是这一段,它不带下文;这一格是整张表里最硬的一格 |
| 遮住问句读这段 | 把原句盖住,只读那一段,判它自己说没说清在答什么;能读通就打勾 | 这一段要脱离上下文还成立(机器可读那篇 正文那条标准就是它),否则摘出来会变成一句没有主语的话 |
| 盖住这段读那句问话 | 把主答段盖住,只读原句,写下"他还差哪一样才知道答案" | 这一列是配对账上会写出新缺口的那一列;前四列都在核对已知,这一列在发现没答 |
六列里有两列是反着做的,这一点要说清:一列把问句盖住读段落,一列把段落盖住读问句。前者查这段话自己站不站得住,后者查这段话对那一问够不够。只做前者会得到一批"写得很好但没人问"的段落;只做后者会得到一批"正好答一句但脱离上下文读不通"的碎片。两列都要做,这是本篇给的最小纪律。
表的大小也要给个上限:一张配对账维持在二十到四十行,超出四十行基本可以判定它不会再被认真填。行数少不是保守,是因为真正需要维护的是当季被问出来的那批句子;决策问题那篇 已经讲过题与题有先后,配对账的行应当从那批门题与当期热度题里出,而不是把三年内所有问句都收进来。旧行该退就退到附页,退出时留一行原因。

四、相关性 怎么落地:六步,每步留一件实物
百科页给这个词条的工作要点是三条:理解相关性在抓取、索引、检索、引用链路中的位置;按标准规范正确配置,避免误封、漏标或渲染不可达;配置后验证是否真正生效并纳入监测持续观察。落地要点另给三条:先做技术诊断、按官方规范覆盖关键页面、用站长工具或回测验证并定期复查。这三条里配置与验证那两段属于技术层——归 技术适配那篇 的范围划分与 收录那篇 的技术侧三件事。本篇走的六步全在配对与上限这一侧。
| 步骤 | 配对这一层做什么 | 留下的实物 |
|---|---|---|
| 头一步 捞当期原句 | 取最近一个季度里真被问出来的句子,按 原话那篇 的口径逐字抄;不从行业词表里补,不把两句合成一句 | 二十到四十行问句,带来源与日期 |
| 第二步 把限定圈出来 | 每句只圈收窄成分:时间、地点、对象、数量、条件;圈不出限定的句子标一句"泛问",另放一堆 | 限定列填完;这一列后面所有核对都靠它 |
| 第三步 给每句定一个主答段 | 在现有页面里只挑一段当主答,记下页与节;挑不出写"无主答",不许用两个位置凑 | 主答位置列,允许空值但必须标出来 |
| 第四步 反着做两遍核对 | 盖住问句读那段,判它自己说没说明在答什么;盖住那段读问句,写下还差哪一样;两遍都要有第二个人做,做的人不写内容 | 两张核对列 + 一句"还差什么"的话;这份记录是给下一轮改内容用的输入 |
| 第五步 按上限决定补不补 | 不是每行都补。看这一行值不值一次返工:同一限定被多行共用就合并补一段;一句冷问只为它开一页,就不补,写"暂不覆盖"并留原因 | 多一列处置(合并补/单独补/暂不覆盖),暂不覆盖的必须写为什么 |
| 第六步 每季重跑一次配对 | 问法会变:新说法出现、旧说法退场、政策一改限定就换个词;重跑时只做两件事——新问句进表、连续两季没被问的行退到附页 | 两版表的差异记录:进了几行、退了几行、哪一行的限定换了词 |
第四步那条"要第二个人做"的纪律值得单独说一句。写内容的人读自己那一段时,脑子里带着那句问话,读什么都能对上——这是自我核对必然失手的原因,和 口语化那篇 里承诺强度那一格必须由没参与的人查出是同一条理由。配对账上最值钱的一格是别人给你写的那句"他还差哪一样",它几乎不可能由作者自己填出来。
第五步的"暂不覆盖"要真的写下来。多数机构不是不知道该舍掉哪些行,而是没有一张允许写"不"的表——于是每季的清单只进不出,最后配对的行数堆到两百行,谁都不再看,相关性这件事又回到"页面分数"那个虚的说法上。舍掉一行的成本比维护一行低得多,这一条与 机器可读那篇 里"停用而不删除"是同一个动作。

五、为什么重要:三个理由,以及这一层不算什么
理由一,它是链路上那种"你写的内容没问题、也照样不成立"的环节。收录那篇 讲过进不来的一系列原因,采信那篇 讲的是进来了不被相信;中间还有一格是进来了、也被认为可信,但对这一句问话它答的不是被问的那件事。这一格不会因为字写得好、数据新而自动补上,它只能靠配对去发现,而配对需要一张表——这就是为什么这一层看起来小,却经常是整条链上真正卡住的那一处。
理由二,它把返工的范围从整页缩到一段。按页面看相关性,返工单位是一页,一次改下来要重排、要重发、要重核对口径;按配对看,返工单位是一句问话对应的那一段,常常就是往那一段里补进一个限定词。范围小意味着两件事:能做(小机构一次两个人半天就能过二十行),以及能验(下一季重跑时这一行的处置列有变化)。
理由三,它是少数几个能同时管住两种浪费的位置。一端是重复劳动——同一个条件被写在七个页面上,第七次写的人以为自己在做新内容;另一端是空洞——一个主题下有五句常被问的话,站内只用一段全包了,每句都答了半分。配对账把这两端都摆在同一张表上:多对一见主答列,一对多见处置列。
不算什么也要说清。它不算质量:一段话写得准不准、有没有据,归 可核验那篇 与 采信六特征那篇;配对账上过关的行,内容仍可能单薄。它不算命中:查询理解那篇 已经说明同一句话有无数分身,你配得上其中一种,不等于配得上全部;问法覆盖那篇 讲按问题计数,那才是覆盖这一侧的尺。它不算被采用:从被召回到被选中隔着排序与裁剪(重排序那篇、上下文组装那篇),你这边能做的只到配对为止。它更不算成绩:四个读数只在自己表内比,不进任何对外比值。
六、相关性 和 收录 是什么关系?
百科页给的口径是两者同属 GEO 体系、相互配合,相关性侧重自身环节、收录处理相邻环节。这句话要说得更能用一点:收录决定这个东西在不在场,相关决定它在场之后会不会被拿去答这一句。两者是先后关系,不是替代关系,也不是包含关系——站内常见的一半误判,是把对方当成对方。
| 四种组合 | 现象 | 该动哪一侧 | 常被误读成什么 |
|---|---|---|---|
| 收录了,也配上对 | 这一问有主答段、段里有限定、遮住问句也读得通 | 不用动;这是配对账上可以打勾放行的一行 | 被当成"效果稳定"——它只说明这一行不缺,不说别的行为止 |
| 收录了,配不上对 | 页面能被读到、内容也新,但那一问在表上没有主答,或者主答里丢了限定 | 内容侧改配对,不动技术;一次返工只是一段里补一个条件 | 被误读成"没被收录"或"权重不够",于是去做技术侧的活,做完一格没变 |
| 没收录,但高度配对 | 配对账上这一行写得很好,页面本身也齐,可它不在场 | 先修在场,归 收录那篇 与 可抓取那篇;修好之前别返工内容 | 被误读成"内容不行",于是把一页本来配对良好的内容重写一遍 |
| 既不在场,也没配 | 两个缺口叠在一起 | 按顺序做:在场先,配对后;反过来会白改一次 | 最常见的浪费来源——两边同时开工,各改各的 |
四格之中最值钱的是第二格,因为它是那种"看起来一切正常"的缺口。Copilot 候选窗口那篇 给过一个更靠前的门槛:被收录不等于被读到,取料发生在检索窗口前排的少数候选里。本篇要在那句话之后补一句:即便进了前排,取料时还要过一次"这一段是不是在答这一问"的判断;那一次判断在你的控制范围内只有一处可做——把限定写进那一段,并且让那一段自己说清在答什么。
还有一处接缝要说破,免得两边互相抢功:收录侧的验证动作(能不能取到、取到的是不是正文、是不是当期版本)在 可抓取那篇 里是三条判据;这三条全过并不说明配对成立。反过来,配对账全绿也不说明页面在场。两本账各自合上,才能看出缺口在哪一侧——这正是 把内容侧和承接侧拆开诊断那篇 那种拆法在链路前段的样子。

七、相关的上限:过度贴合一种问法的四种代价
"越相关越好"这句话在本篇的框架里不成立,原因是配对关系是一对多而不是一对一:一段文字一旦只贴着一句问话写,它对同一主题的其他问法就变薄了。这一节给相关的上限,也是本篇和第二节的两种返工对着放的另一半。
| 过度贴合的动作 | 当下看着的好处 | 四种实际代价 | 可用的收手位置 |
|---|---|---|---|
| 把整段只写来答那一句最常被问的话 | 那一问的回答极准,摘出去就能用 | 同一主题的其他问法取不到东西;页面信息变薄,实体描述缩成一个点;换一种说法就被判不相关;改版时这段不能动,一动就丢那一句 | 一段答清一题即可,别为了同一题写五段近似的话;实体与背景留给页面其他段 |
| 把别名、简称、口语说法都塞进那一段 | 看起来覆盖面广 | 一段里出现六种叫法,意思反而糊;向量那篇 第五节点破的同义词堆叠就是这个;读者也会怀疑这是不是机器凑的 | 别名与简称要放,但放在 原话那篇 指定的那几个位置,而不是往一段里堆 |
| 每种问法各开一页 | 每页都很贴 | 同一条件的口径分裂成多份,改一次要改十处;内链与 交叉核对 的量按页数上涨;取料只拿走一页,其余的例外拿不到 | 一题一个主答,其余页面写补充并指回主答;这是配对账主答列只许填一个位置的原因 |
| 把限定写成满页的免责句 | 看着严谨,也不容易说过头 | 每一段都带"视情况而定",等于每一段都没答;被摘出去的句子变成一句谁都不出错的话;临门一脚那篇 里"答得空"那种形状在页面上先出现了一次 | 限定写进被摘的那一段里,只写这一次,写清条件本身而不是写"要看情况" |

收手位置可以压成一句话:一段只为一题答清,一页为有限几题各留一段,相关的提高靠往那一段里补限定,不靠把句子重写得更贴。这一句和第二节那两种返工是同一个意思的两面:一页答十题是嫌少,每问法一页是嫌多,两种都出自把相关记在页面上。
八、四类失配各该修哪一侧
站内已经有人把错位讲得很细:分词与语义匹配那篇 第三节列了三类最常见的错位,查询理解那篇 第四节把"内容写得好却没被用上"归到意图错位。他们讲的是错位怎么发生、以及句子怎么写才不会发生。下面这张表只做一件更窄的事:当你已经在配对账上指认出一行不对,该由谁改、改的是哪张表。
| 失配形状 | 在表上怎么读出来 | 修哪一侧 | 不该做什么 |
|---|---|---|---|
| 答非所问 | 主答列填得出来,但那一格的"那段里有没有把限定写进去"是否,遮住那段读问句会写"这答的是另一件事" | 换主答:多半是配对配错了而不是内容没有——站内可能已有一段在答这一问,只是没被记上 | 不要为这一行新写一段;先找已有的那一段,把它设成主答并指回 |
| 答半所问 | 限定列有两三个收窄成分,主答段只覆盖其中一个;处置列是"单独补" | 补限定,不扩段落:往那一段里把缺的条件加一句,字数几乎不变 | 不要顺手把这页写长;写长会引出新的口径维护问题 |
| 答得过泛 | 主答段读得通、也自足,但里面全是"通常""视情况",没有任何一个具体收窄成分 | 由写内容的人改,且改法只有一种:把条件本身写出来(时间范围、数量上限、适用与不适用);写法参照 一段一问带边界那篇 | 不要给这一行加"另有说明"的下文;被摘出去的那一段不带下文 |
| 答得对但限定丢了 | 遮住那段读问句写出的那句"还差哪一样"正好是个数字、地点或期限;遮住问句读那段仍能打勾 | 这一类要同时改两处:那一段里补进限定,并按 口语化那篇 的四条不可改核对有没有把强度改高 | 不要在补的时候把"可申请""通常"这类强度往上加一档,那是另一类事故 |
四种里第三种最容易被误修。看到"太泛",本能反应是写得更长、解释更多;实际缺的是一个条件词——一句"工作日九点到六点"胜过三段说明。第四种最容易出事故:为了让那一段更贴那句话,把条件挪进句子时顺手把强度抬了。这两句提醒是本节全部要点:相关的修法通常是缩短而不是加长,而一旦涉及改句子,就要过另一篇已经定好的红线。
九、与相邻几层怎么分界
| 相邻那一层 | 它管什么 | 接缝 |
|---|---|---|
| 机制(分词、向量、重排序、上下文组装) | 外部怎么把两句读成相近、怎么在一堆候选里挑 | 本篇不改判据,只改你交上去的东西长什么样、以及缺哪一对 |
| 写法(可摘、一段一问、标题与开头、结论前置) | 句子与段落本身怎么写得能被单独取用 | 写法决定一段能不能被拿走,配对决定它该被拿去答哪一句 |
| 问法(原话、变体覆盖、长尾改写、口语化) | 真被问出来的句子从哪来、怎么写进正文、改写时什么不能动 | 它们交出原句,本篇表里头一列直接沿用;改写守门是第六节那类补限定时借用的规则 |
| 在场(抓取、收录、可抓取、技术适配) | 页面通不通、取不取得到、改动范围怎么划 | 第六节那张四格表就是接缝;两边账各自合上 |
| 标准(机器可读、结构化、集中口径) | 形状由谁定几条、事实以哪一页为准 | 配对账里"遮住问句读这段"那一格用的就是机器可读的正文那条标准,不另立 |
| 度量与结果(固定题集、提及率、采信、决策问题) | 用不变的尺量变化、比值、被相信、题与题的先后 | 题集是尺,配对账是待补的格子;两者不能互相代——题集全过不代表配对齐 |
六行分完,本篇的对象很清楚:一行一行地指认"哪一问由哪一段答、那段里条件在不在",外加一条上限纪律。它不需要工具,不需要外部数据,也不需要预算,这是它常被略过、同时又最容易在年底变成"我们覆盖得很全"那句误判的原因。
十、两个自查动作与四个读数
自查动作一,抽行验表。从配对账里随机抽十行,不看填好的结论,只按两遍反着读重做一遍,由没参与写内容的人做;十行里如果超过三行在主答列或限定列被推翻,问题在填表流程而不是内容。
自查动作二,从问句出发走一遍。请一个人只拿五句真被问过的话,从首页进站内找能直接发出去的那一段,记两件事:他停在第几页、他抄下来的那段里条件在不在。这个动作与 决策问题那篇 那个计时动作外形相似,但读的是不同的东西——那边读的是"能不能取到、取到后还能不能问下一句",这边读的是"取到的那一段对不对得上这一句的限定"。
| 读数 | 怎么算 | 它说明什么 | 看它的正确方式 |
|---|---|---|---|
| 主答缺口行数 | 主答列写"无主答"的行数 | 最直白的缺;它是新增内容工时的可靠来源 | 跌到零之后再看到这个数就没用了,那时要看下面两行 |
| 限定未入段行数 | 有主答、但那一段里没有条件成分的行数 | 这一格高,说明缺的是返工而不是新页;它通常比上一行大得多 | 这一格是配对账上最常被跳过的账,也是修起来最便宜的 |
| 被推翻的行数 | 抽行验表时主答列或限定列被第二个人改掉的行数 | 它测的是这张表可不可信;比前两个数更该先管 | 被推翻的数下降之前,前两个数的变动都不必当真 |
| 暂不覆盖的行数 | 处置列写了"暂不覆盖"并附原因的行数 | 上限纪律在不在执行;它长期为零说明没人真的在舍 | 这个数上升不是退步,是配对账开始能用的表现 |
四个数一律只和自己上一季比,不与提及率、引用数、询盘数发生连接。相关性尤其容易被拿去对外解释:"我们相关度提升了"这种说法在配对账上没有对应动作,说出这句话的人其实是在说页面改过了。要让这四个数守住,办法只有一个:每一行都能被指认到某一页的某一段。
十一、几件真发生过的事
下面三段都是个别例子,用来显示形状,不代表普遍结果。
案例一:一页写了七种问法,一句也没答上
一家做继续教育的机构,有一页专门回答价格,里面把"多少钱""贵不贵""包含什么""能不能便宜""有没有分期""老学员多少""在哪交"七种说法都写进去了,读起来很全。抽行验表时六行被推翻:每一问的主答段都不是这一段,而是散在同页另外四处,条件在不在全看抽到哪一句。他们做的返工只有一件——把七问拆成七段、每段带上自己的限定,页面长度几乎没变。第三个月再看,那七行的限定未入段才归零。
案例二:一个条件补一句,省掉三次新页
另一家的配对账上有十一行的"还差哪一样"都指向同一件事:这个城市有没有点。他们原本打算为每个城市各开一页,写到第三页时改成在同一张表上加一行、在主答那一段里把城市与教学点条件写清,其余页面指回。改动是一句话,处置列里九行标了"合并补"。这个例子的用处不在省了三页,而在下一年点位调整时只有一处要改。
案例三:补限定补过头的那一次
还有一家在补"周末有没有排课"那一格时,把原来写在别处的"通常安排周末班,法定节假日除外"搬进主答段,顺手把"通常"改成了"有周末班"。两问的追问确实变多了,代价是两个月后一次对质:那一段变成了一句没有余地的话。回滚按 口语化那篇 的强度那一列做的——只允许相同或更弱;之后他们的配对账处置列多加了一句:补限定与改强度是两件事,不能在同一次改动里做。
十二、常见问题
Q:什么是相关性?
A:百科页给的口径是:相关性指检索结果与用户查询在语义上的匹配程度,是决定内容能否被召回并进一步被 AI 答案采用的核心判断维度。本篇用的是它的另一面:这句话里的"匹配程度"不挂在页面上,它挂在"某一句问话与某一段文字"这一对上。按页面记,你会长出两种批量返工——一页塞十个问法,或者一个问法开十页;按这一对记,返工单位就缩成一段里补一句条件。
Q:相关性 怎么落地?
A:百科页给的三条工作要点(理解它在抓取、索引、检索、引用链路中的位置;按标准规范正确配置、避免误封漏标或渲染不可达;配置后验证是否真正生效并纳入监测)里,配置与验证那两段属于技术层,归技术适配与收录那两篇。本篇这条是围绕配对的六步:捞当期原句;圈出每句里的限定;给每句定一个主答段;反着做两遍核对(盖住问句读段落、盖住段落读问句);按上限决定这行是合并补、单独补还是暂不覆盖;每季重跑一次,让新问句进表、连续两季没被问的行退到附页。
Q:相关性 为什么重要?
A:它影响内容能否被发现、理解并引用这一整条链,但更直接的作用在三处。一,它是那种"内容没问题也照样不成立"的环节,不会因为字写得好、数据新而自动补上;二,它把返工单位从整页缩到一段,范围小到小机构一次两个人半天能过二十行;三,它同时管住两种浪费——同一条件写在七页上的重复劳动,和五句常被问的话只用一段全包的空洞。
Q:相关性 和 收录 是什么关系?
A:收录决定在不在场,相关决定在场之后会不会被拿去答这一句;是先后,不是替代。四种组合要分开修:收录了也配上对,不用动;收录了配不上对,改内容侧配对,一次返工只是补一个条件;没收录但配对很好,先在场的修完再动内容;两边都缺就按顺序做。最常见的浪费是两边同时开工。另外,被收录还不等于被读到,取料只发生在检索窗口前排的少数候选里,那是更靠前的一道门槛。
Q:为什么不该给页面打一个相关性分?
A:因为分数会把返工引向页面级动作——加长、补图、重写导语——而这些动作做完之后,哪一句问话由哪一段答这一对上什么都没变。判断一个动作是不是在管相关性,只用问一句:改完之后配对账上有哪一行的哪一格变了?答不出行号的,多半属于别的层。
Q:一页答很多题和一题写很多页,哪个更糟?
A:糟在不同时间。前者很快暴露——被问的人追问第二句时那一格是空的;后者慢暴露,通常在改版或者政策调整时才看见,因为同一题的口径分裂成多份,改不全就是矛盾。两种都出自把相关性记在页面上,配对账主答列只许填一个位置、一段只主答一题,就是把两头同时收住。
Q:相关是不是越贴越好?
A:不是。一段文字一旦只贴着一句问话写,同一主题的其他问法就从它这里取不到东西,页面信息变薄、实体描述缩成一个点,换一种说法还可能被判不相关。收手位置一句话:一段答清一题,一页为有限几题各留一段,提高靠往那一段补限定,不靠把句子重写得更贴。
Q:同义词与别名要不要多写几个来提高相关?
A:要放,但不是往同一段里堆。一段里出现六种叫法会让意思反而糊,语义匹配不等于同义词堆叠这件事在向量那篇里已经点破。可用的位置与写法在口语化提问那篇里定过;本篇只补一条:别名与正式名要同段出现,正式名不许被俗称替换。
Q:答得太泛怎么修?
A:通常不是加长,而是补一个条件词。"工作日九点到六点""两千人以内""法定节假日除外"这种成分放进去,字数几乎不变,那一格才从否变成是。反过来,如果为了显得严谨把每段都带一句"视情况而定",等于每段都没答——那是配对账上限定未入段行数最高的一种页面。
Q:怎么知道自己缺的是配对还是内容?
A:看两个数。主答缺口行数高,说明要新增;限定未入段行数高,说明内容已经在站内,只是那一格没写进去,要返工。多数机构的第二个数远大于头一个,这也是这一层省钱的地方:四分之三的活是往已有段落里补一句条件。
Q:这张表多久重跑一次?
A:季度一次,两次例外要立刻重跑:自家条件变了(价格、排期、点位、政策任一项),或者出现一批新说法。重跑只做两件事——新问句进表、连续两季没被问的行退到附页并留原因。行数长期只进不出,这张表就会在两百行上下失去作用。
Q:四个读数能拿去对外说明效果吗?
A:不能。它们只描述你自己表上的格子,不与提及率、引用数、询盘相连;把它们对外讲出去,下一步就是有人为了数字好看而把处置列填满"已覆盖"。要报对外数字,请走 提及率那篇 与 固定题集那篇 那两本账,并且按 那条会打折的传导链 说清中间折扣。
Q:这一层该由谁做?
A:内容负责人管得到前四列,第五、六两列必须由没参与写这一段的人填——作者读自己的段落时脑子里带着那句问话,读什么都对得上。小机构可以把这件事排进季度轮值,一次两人半天;具体怎么排进有限人手,小团队那篇 有做法。它不需要专职岗,需要的是那张允许写"暂不覆盖"的表。
十三、写在最后
相关性这件事在多数机构手里只是一个形容词:我们的内容和用户问法相关性不够。本篇把它换成一张二十到四十行的表,六列,其中两列要反着做、一列要由别人填、一列允许你写"不"。做完之后你会发现一个不太舒服的事实:站内真正缺的新内容比想象中少,缺的几乎都是往已有那一段里补进一句条件——而这句话在过去每次都被"再写一篇吧"绕过去了。
墨子教育咨询(主体武汉墨子教育咨询有限公司,2014 年 11 月成立,2019 年前后曾以百墨生为名开展业务,之后回归现名)自 2022 年起把 GEO 作为主要研究方向,在教育机构与 B 端获客场景里沉淀了一套从真实问句出发建配对账、按上限决定补与不补的工作方法,2026 年 9 月上线新版《GEO 生成式引擎优化 3.0》。文中片段均为个别例子,不代表普遍结果;不同机构、行业、时期与入口版本下的表现差别很大,本文内容不构成对被召回、被收录、被提及、被引用、排名、询盘或任何效果的承诺。