什么是hreflang?-墨子教育咨询

摘要:hreflang 是标注页面语言与地区对应关系的 HTML 属性,帮助引擎为不同语言、不同地区的用户选择正确版本。站内把怎么配、站点结构怎么选、跨语言实体怎么对齐、各家引擎怎么读都讲过了,本篇只占成组性与边界这一层:它不是页面的一项属性,而是一组版本之间的互指关系——只在新版上标、旧版没标回来,那一组就不成立。三种伪动作(只在新版标、给单语言全站补标记、把还没上线的版本先写进组)每一步都能交出东西,但组里一对互指没变;四条判据是双向、封闭、对得上语言、不与正本声明越权。落地六步只做成组:先列版本组、算出组数与实际版本数的差,逐组核双向,找有页无组与有组无页两张清单,决定改标注还是改内容,把新增版本必须入组写进上线那一栏,每季重跑。它与 Gemini 的关系:这条标注属于 Google 那一侧的地基规则,完整性要求随入口不同而不同,但内容只该有一套。文中片段均为个别例子、不代表普遍结果,不构成对被收录、被抓取、被提及、被引用或任何效果的承诺。

一、先把范围圈出来:hreflang 指什么,本篇与站内那十几篇怎么分

百科页给的口径是:hreflang 是标注页面语言与地区对应关系的 HTML 属性,帮助引擎为不同语言、不同地区的用户选择正确版本,对多语言与跨境场景里的实体一致性有作用。这句话里"对应关系"四个字是要害,可大多数人读完之后做出来的动作是"给页面补上语言标记"——补完确实每一页都带了标记,但只有带了标记的那一版知道其他版本存在,其他版本对这个方向一无所知;标记加了一堆,那一组关系没成立。

这一族站内写得极密,先摊开,本篇不重复它们。配置与站点结构那一侧:《多语言、外贸独立站的英文 GEO 怎么做?实体口径怎么统一》把这门技术必修课怎么配、域名/子目录/子域名三种组织怎么取舍、语言与地区为什么要组合着看、机器翻译怎么用才对、多语言站常见技术坑都写完了,第十三节还专门算了小语种值不值得单独做这一笔账。Gemini 上线前那份踩坑清单与 30 分钟体检把 robots、noindex、canonical 与语言标记排在一起逐项过;Gemini 时代的技术地基那篇管收录、爬虫放行、结构化与知识图谱;跨境团队做 Gemini GEO 那篇管 Google 国际站与英文一手内容。

组织与运营那一侧:《多语言站点 GEO 怎么做:本地化、实体对齐与逐语言可达》管各语言页面的可达性、度量为什么要按语言分开看、扩语言时别让各版本更新脱节,以及"只挂一个语言切换按钮不等于做了多语言";跨境独立站分层落地那篇第九节管独立站这一关;跨境 GEO 落地八步那篇管动线,出海 GEO 价格那篇管语言与市场带来的那几块增量。

跨语言实体与各家读法那一侧:《跨境 GEO 和多语言实体是什么关系:不是把中文做法搬过去》把实体在另一种语言里断开的三种典型形态摆开,Claude 时代的多语言实体那篇讲中英材料要能被独立读通又互相对得上,Copilot 跨语言检索那篇、Perplexity 跨语言检索那篇、ChatGPT 侧英文内容与多语言实体那篇各管一家的读法,品牌实体辨识那篇管被写成别家;《什么是品牌事实?》管各语言里那些条目本身。

链路上相邻的词条另有 《什么是网站技术适配?》(其中"全站做一次、按引擎两处、不必分引擎"那三层与本篇第四节直接相接)、技术配置清单那篇、《什么是机器可读?》、《什么是抓取?》、《什么是可抓取?》、《什么是收录?》;口径归 《什么是单一事实源?》,一问由哪一段答归 《什么是相关性?》,量的尺归 《什么是固定题集?》 与 《什么是提及率?》,工具归 技术类体检工具那篇,措辞归 《什么是口语化?》,结构化标记的形状归 结构化写法那篇 与 排版层与问答标记对齐那篇。

这些篇目把"这一条怎么配、配在哪些页、站点结构怎么选、跨语言实体怎么对齐、每一家引擎怎么读"都讲完了。中间少的是三件很具体的事:一条语言标记在什么条件下才算成立;组里"该有的版本"与"实际有的版本"不一致时怎么把它查出来;以及它管不着哪几件事——很多人是把它当成提高多语言可见度的开关去用的,配完之后另一种语言的引用一条没多,就来一句"这属性没用"。本篇只占这一层:成组性与边界。语法细节、站点结构、实体对齐一律指路,本篇不复述。

三条边界。头一条,本篇不讲写法——语言码怎么写、地区和语言为什么要分开、那一行兜底版本怎么留,这些在 多语言那篇第三节 与官方规范里已经定清,本篇默认你会配、只是不知道配没配成。第二条,本站只有一种语言的机构,本篇不劝你加:第四节往后有"不该标的四种情况",其中头一种就是没有并列版本。第三条,它不带来任何结果说法:这条标注只影响"同一件事的几版说法被算成几份材料",判的那一方不是你;本文所有动作不构成对被收录、被抓取、被提及、被引用、排名或任何效果的承诺。

语言标记成立的条件
它不是一项页面属性,而是一组版本之间的互指:只有带了标记的那一版知道其他版本存在,这一组就不成立

二、单位错了会长出三种伪动作

把"对应关系"读成"页面属性",动作就落在页面上:一页一页地补标记。三种最常见的伪动作都从这里长出来,共同点是每一步都能交出一点东西,但那一组关系一格没变。

伪动作当时的理由按互指关系看实际发生的事多久会暴露
只在新版上标英文版是这次新做的,先把它的标注写齐;旧版改动成本高,等下一批新页列出了其他版本,其他版本里没有这一条。两版之间的关系是单向的,那一组不成立;更糟的是新页被当成一份独立材料,与旧版一起进候选池,两条各说一版快——下一次由另一种语言发起的回测就会发现旧版仍然被单独取到
给全站每一页补齐语言标记既然这是标准字段,那就整站统一加上,一次做完不留死角全站只有一种语言时没有并列版本可指,标记指回的还是它自己;多出来的是每一页上一处会写错的地方,以及一次"我们已经做了多语言优化"的内部汇报慢——它不犯错,只是永远不出活,通常在盘点时被划进"已配置"再没人看
把还没上线的那一版地址先写进组版本下季度就上,先把关系搭好,上线时就不用再改组里出现一个不存在的条目;读到这一串时那一格是空的,为了填这个空位可能把已经写对的版本挤掉。同一批里还有一个反向变体:旧版已下架但条目还挂着中等——到那一段被再次读到、或有人按那串地址去取一次才发现

第三种里"先搭关系"那一支值得多说一句,因为它在机构内部最容易被批准:它看起来像提前规划。判断一个动作是不是真在管这一层,本篇只问一句:改完之后,组里哪一对互指成立了?如果答案是"更多页面带上标记了",那这个动作不属于这一层,多半归 技术配置清单 里"整齐交出去"那一侧。而"提前把没上线的版本写进去"这件事的问题不在想法,在顺序:这一组关系只有当每一版都真实存在、内容也确实对得上那个语言时才有意义,早写的那几行不但没生效,还会在中间那段时间里把整组拖成可疑状态。

把单位从"页面"换成"版本组",还有一个立刻可见的好处:它让这件事的工作量头一回变得可估。按页算,你要处理几百个页面;按组算,一家做三种语言、每个语种十几个主要主题的机构,需要维护的是十几到几十组,每组三到四版。这个数量级才是能在一个季度里做完的事,也是本篇后面所有表格按这个规模设计的原因。

三、成组性:四条判据,前三条是核对,第四条要做决定

这一节给本篇的正面定义。"这一组成立"要同时过四条,每一条都有一个半天能跑完的查法,不需要外部工具,也不需要拿到引擎内部数据。

判据它说什么怎么查不合格时的样子
一 双向组里每一版都要把其他每一版列进去,也包括它自己。三版就是每条各写三条,不是只在头一版写三条抽两版对着读:这一版的清单里有没有那一版;再倒过来读一次。一个方向缺,这一对就作废新版列得整整齐齐,旧版一条没有——看起来"已经配了",实际两版各过各的
二 封闭组里出现的每一个地址都要真实存在、可被抓到;不存在或已被撤下的条目不该留在清单里逐条访问那一串地址,记下打不开、跳转去别处、以及跳转之后落地语言变了的那些一串里有两三个空位;或者地址跳到另一主题的页面,读到的内容与那行标完全无关
三 对得上标注的那一语言地区,要和这一页实际写的内容一致。机器读到的仍然是正文,标注只负责分堆,堆分错了正文照样被读遮住标注只读头三段,先判它自己是什么语言、面向哪一地区;再翻开标注比对。两处说法不一致就是不合格标给某一语言的页正文是另一语言的草稿,或者正文还是原来那一版换了个地址;分堆分错,堆里的材料却还在
四 不越权并列声明与"重复里以哪一版为准"是两件事,方向不同:一个说这组里有哪几版并列,一个说这一堆相似页面里以哪一版为正本每一版看两个地址是否一致:它自己声明的正本,与它当前的地址。正本指向组里另一版时,这一版就不该再出现在并列清单里两件事各写各的:一处说这几版并列、另一处说其中一版才是正本,两个声明互相抵掉,等于两组关系都不成立

四条里只有第四条需要在两个声明之间做决定,前三条都是核对。这一点要提前说清,因为它决定了后面六步里哪一步最费人:第三步之前都是查,第四步要有人拍板"这一对到底算并列还是算重复"。而这个问题本篇答不了——它取决于那一版内容是不是自己写的一手材料,判据在 本地化与翻译化那一节 和 把英文页当翻译页做那一节 里:换语言重做一遍调研、把当地的说法与例子写进去的,算并列;只是把原来那一版换个地址放出去的,算重复,该走正本那条路。

还有一条纪律是给规模的:一个主题下的版本数超过四种语言,就分堆来管,别指望一张表记住全部。这与 小语种值不值得单独做 那一问不同——那里算的是要不要开这一版,这里算的是开了以后还管不管得住。八版一组时,双向核对要在六十四对里做,没人会认真填完;把它拆成两堆、每堆不超过四版,核对才重新变成一个下午的事。

版本组与互指
按页算是几百个页面,按组算是十几到几十组、每组三到四版;单位换了,工作量才头一回变得可估

四、hreflang 怎么落地:六步,每步留一件实物

百科页给这个词条的落地要点是三条:先做技术诊断、按官方规范落地配置并覆盖关键页面、用站长工具或回测验证生效情况并定期复查。这三条里"按官方规范配置"归 多语言那篇,"用站长工具验证"归 技术类工具那篇,"技术诊断"的入口在 网站技术适配那篇 的范围三层里。本篇这六步只做"成组"这一件事:先把组列出来,再核双向,再找两类不一致,再决定改哪一侧,再把入组变成上线动作,最后每季重跑。

步骤成组这一层做什么留下的实物
头一步 先把版本组列出来不动任何页面。把全站带语言标记的页面按主题归堆:同一主题的各语言版本算一组,逐组写下现在实际有几版、每一版的地址。归不下去的单独记"孤儿页"一张组清单,一行一组:主题、版本数、各版地址。头一回列出来时最常见的发现是组数比预想少——同一主题各页各写了一套,其实一组成形都没有
第二步 逐组核双向每组一张台账:行是版本,列是"这一版有没有把组里其他每一版列进去"。逐格打勾,缺谁就写谁的名字,不写"不完整"这种没法执行的词每组一张台账 + 一个数字:缺双向的对数。一次核十组以内,超出的排下一轮
第三步 找两类不一致有页面但没进任何组的,列进"补标注";进了组但页面打不开、跳转走了、或已经下架的,列进"撤标注"。两条清单都写明由谁改、什么时候改完两张缺口清单。它们比台账有用,因为台账上一堆勾看不出该动手的是哪几行
第四步 标了但内容对不上的,决定改哪一侧判据只有一句:这一版的内容配不配得上它被标的那个语言与地区。配不上又有一手内容的,改标注;只是原来那版换个地址的,改内容一侧要极谨慎——别为了对上标记去重写那一版已经被拿去作答的文字每一行一句处置说明(改标注 / 改内容 / 撤掉),并写明这一行的正本那一版是谁
第五步 把"新增版本必须入组"变成上线动作上线表加一栏:这一页属于哪一组、组里其他版本有没有回指它。由提交人填,上线前签名字;空着就不上线。旧版本被撤下时同样走这一栏,撤一版要顺手把其他各版里那一行删掉上线表上那一栏与签名。这一步与 单一事实源那篇 的取数闸是同一个形状:不靠人记得,靠一处不得不填
第六步 每季重跑第二步只重跑核对,不往里加新主题。看两个数字:缺双向的对数、不在组的版本数。这两数不涨就算维持住了两个数字的历史记录。加一版容易,让三版同步改一次难,所以重跑的间隔不能超过一个季度

六步里最容易被跳过的是头一步,也最不能跳。它交出的那个数字——组数与实际版本数的差——决定了后面所有步骤的性质:如果差得远,说明问题不是"有几处写错了",而是各页从来没按主题归过堆,那第二步要重新设计分组,而不是硬核对;如果差不大,那就照着台账一格一格补。这个顺序也和 技术适配那篇 里"先分清哪些做一次、哪些按引擎两处"是同一类动作:先划范围,再谈修。

成组六步
不动页面只做一次盘点,先看清组数与实际版本数的差;那个差决定了后面几步是在补错还是在重新分组

五、为什么重要:三个理由,以及这一层不算什么

理由一,它决定的是"几份材料"而不是"写不写得好"。同一主题的中文版与英文版如果没成组,被读进去的是两份各自独立的东西;两份都在讲同一家机构,但说法不会自动一致——数字、限定条件、承诺强度各有一版。这时候口径问题被放大成两份材料的冲突,而冲突怎么被消化,那是 矛盾信息里机器偏向哪一边那篇 讲的环节,不是内容写得好不好能补的。成组的作用就在这里:它把"两份独立材料"变成"同一件事的两种说法",让后面那些口径工作有一个可以对齐的对象。

理由二,它是多语言投入的止损闸。开一种语言的成本在 出海价格那篇 里算得很直白:贵在语言、市场、渠道与时差那几块实打实多出来的工作量上。如果这一版做出来从来没被算进任何一组、也没人和另两版一起复查,它大概率会停在"上线那天最好"的状态:多语言站点那篇 第八节讲的各版本更新脱节,正是从这种页面开始漂的。成组这件事很便宜——一组三版,一次核对一个下午——但它给"要不要再开一版"提供了一个诚实的答案:加一版就是加若干组,每组都要有人管双向。

理由三,它是少数能自己查出错的环节。抓取成不成、被不被引用,都要等外部给反馈;而组关系全部在你自己的页面里,抽两版对读就能查。这不是小事:一个能自己查的环节可以放进季度例行,一个只能等的环节只能放进汇报。本篇第四节那六步全部只依赖站内可见的东西,理由就在这里。

不算什么也要写清,因为这一层的误用大多来自把别的成果记在它账上。它不算多语言内容本身——哪种语言该答哪些问题、题池怎么按语言分开挖,那是 多语言站点那篇 与 跨境八步那篇 的活;一条标注不会让一种语言里没人写过的题凭空有答案。它不算跨语言实体识别——同一家机构在另一种语言里被认成别家、或和相近名字的公司混在一起谈,那是 多语言实体那篇 与 实体辨识那篇 管的事;标注只在你站内把版本分开,站外别人怎么写你这个名字它管不着。它不算收录与可达——那一版根本没被抓到,成不成组都不会有下文,先走 收录那篇 与 可抓取那篇。它更不算效果:把组修得再齐,也只改变"被算成几份材料"这一件事,不构成对被收录、被提及、被引用、询盘或任何结果的承诺。

成组改变的是被算成几份材料
成组与否改变的是"两份独立材料"还是"同一件事的两种说法";这一点决定后面所有口径工作有没有对象可对齐

六、hreflang 和 Gemini 是什么关系?

先划走已经写过的那部分:那份踩坑清单 已经把"Gemini 背靠 Google,因此继承了 Google 侧二十年沉淀的一堆老规则,只搬另一家打法会水土不服"讲透了,包括把英文页当翻译页做、robots 一行挡掉整个索引、结构化与正文对不上这些项;技术地基那篇 管它隔着索引看你这层,跨境团队那篇 管国际站与一手内容。本篇在这节只占一句:这条标注的"完整性要求"随入口不同而不同,但内容只该有一套;把它当成跨引擎通用配置去做,或者反过来为几家引擎各做一套多语言,都是从同一处出发走歪的两条路。

具体分辨靠两件事。头一件,走检索那一侧的入口,版本组是不是完整,会改变同一主题的几版材料是被合成一件事、还是各自作为独立候选进池:组完整时它们像同一件事的几种说法,组残缺时它们像两份互不相干的资料,后者在"多个版本同框"时反而互相牵制——这一现象在检索型入口上更容易遇到,而在另一类靠预训练语料消化印象的入口上,你站内的这一行标记几乎没有存在感,那里读的是语料里你被写成什么样。第二件,反过来不成立:不能因为某一类入口不读这行标记,就说"这属性没用",也不能因为某一家读,就为它专门做一版内容。前者是 英文语料那一侧 与 跨语言检索那篇 各自管的,不归这行标记。

常见说法它在哪一半是对的走歪之后会变成什么动作本篇的处置
"这一家引擎不认这个属性,可以省了"省掉的部分确实存在:那一类入口按整页文本走,标记不是它们的门槛顺手把整站的组维护也省了,等下一次做检索型入口时无账可对;同一批页面还留着残缺标注,读起来比没标更乱该省的是"为这一家单独重做内容",不是"把维护停掉"
"配好它,另一种语言的引用就会起来"它确实让两版不再各说一版,前提是那一语言里有人写过的题被答上配完就等着,另一种语言一篇内容没多写;缺口在题池那一侧,标记不会替它补把它记在"材料被算成几份"这一格,别记在可见度那一格
"几家引擎各配一套最稳"各家读法确实不同,验证时要分别看同一段话被写成四版口径,反而把 事实源 那一侧的分叉打开;改一次条件要改四处内容一套、验证分开看;这跟 技术适配那篇 "不必分引擎"那一层是同一判断

所以这一对关系可以用一句话带走:这一条标注属于 Google 那一侧的地基规则,做它要把整组做完整;而它完整与否都不替你回答另一种语言里那些问题——那一半永远是内容与题池的活。两边都记在账上,才不会在"配了没用"和"配了就够"之间来回摆。

七、不该标的四种情况

上一节第二行讲的是一个动作被高估,这一节讲另一个方向:这行标记在很多站点上根本不该存在,加上去只剩维护负担。四种情况里,头一种在中文机构里最常见,也最少有人愿意承认。

情况为什么不该标该做的替代动作
全站只有一种语言没有并列版本可指,标记指回的还是它自己;多出的是几百处将来会写错的地方什么都不做。真准备开第二语言时再从头一步(列组)开始,那时才有对象
那一版只是复制页同一内容换个地址再放一次,属于重复不是并列;并列清单里放它,等于给同一份材料做两个候选走正本那条线:一处为正本、其余指回它。判据在 本地化那一节:没重做调研就不算另一版
那一版开在你改不动的域外第三方平台上那一家店、别人整理的名单,你写不了它们的页面,也删不掉;把它们列进组,组的封闭性当场破当镜像记,别将就地写进清单——这一处置与 单一事实源那篇 第八节那条"改不动的东西不能进你的账"是同一条纪律
为凑语言造出来的薄版本正文是直译草稿、例子和数字都没换,被读到之后反而损害另一种语言里对这一家的判断;它满足"有这一版",不满足"配得上这一版"撤掉比留着好。要留就先按 翻译与本地化那一节 把内容做齐,再入组

这张表还有一个用法:它可以直接当"撤标注"那张清单的判定标准。第四节第三步里那句"进了组但页面打不开、跳转走了、或已经下架"讲的是坏掉的条目,这里讲的是从一开始就不该存在的条目。两者都要撤,但撤的理由不同——前者是修,后者是承认范围划错了。范围划错这件事在 技术适配那篇 里管"哪些做一次、哪些按引擎两处",本篇管的是"这条规则在这个站点上有没有适用对象"。

不该标的四种情况
没有并列版本、只是复制页、那一版在改不动的域外、为凑语言造的薄版本——四种情况都该撤而不是补

八、四类走形:样子很像在维护这一层,实际在把它做坏

走形与错误不同:错误是写漏了,能靠核对抓出来;走形是动作方向对、做法让它维持不住。这一层我见过的四类,每一类都在内部汇报里被写成进展。

走形一,把标注当成"多语言已完成"的证据。汇报里出现"我们已支持四种语言",实际成组的只有首页那几组,深层页面一条互指都没有。首页是最好补的地方,也因此最没用的地方——真正被拿去作答的多是具体问题的深层页,这一点在 只做首页那一节的教训 里已经说过,本篇补上它的另一面:组关系也是从深层页开始断的,因为深层页数量大、改版频繁,还没有人对着台账看。

走形二,每一版各自手写那一串清单,从不从上一版复制。漏一版就是这么来的,而且漏的位置很随机。纪律很朴素:一组里那一串清单只能有一处母本,其余各版照抄同一串(只把自家地址换成对应位置)。这条与 机器可读那篇 里"重复的东西不要各写各的"是同一思路,只不过对象从字段换成一串对应关系。

走形三,为了对齐把各版的更新节奏强行绑在一起——改一处必须三版同改,一周内不齐就算不合格。听着像严谨,结果没人敢改:改一个数字要走三种语言的流程,最后大家都不改,页面停在最初那一版。这跟 扩语言时别让各版本脱节 那一节是同一问题的两侧:那边讲的是别让各版漂远,这边要补一句的是别用同步把改动封死。能维持的做法是按组规定最长允许多久没齐,而不是要求同一天。

走形四,把范围一次铺到全站。组数从二十几组涨到三百多组,然后维护停摆。这一条的解法与 技术适配那篇 第八节"只在关键页做,往外扩要有前提"完全一致:先把真正会被拿去答那一问的那批页面成组,其余排在其后,并接受一张永远没有全绿的台账。

九、与相邻几层怎么分界

本篇所有的"这一层不管"都要落到某一句上,否则就成了推诿。这张表的右列写明混用时的代价,那是最容易在内部会议上被说服去做的事。

相邻那一层它管什么本篇管什么混在一起时的代价
收录 / 可抓取(收录那篇、可抓取那篇)那一版在不在场、取不取到在场的那几版有没有被算成一组拿标注去修收录,或把没收录当成没标注;两边一起挂着不动
机器可读(机器可读那篇)字面读不读得懂、能不能单独摘出去读得懂的这几版怎么分堆写了一堆能摘的句子却各版各写一套,口径分叉
相关性(相关性那篇)哪一问由哪一段答那一问在该语言里由哪一版答给整站提"语言覆盖",但那种语言里没人写过那一问的答案
单一事实源(事实源那篇)这一条事实哪一处能改各版引用的是不是同一处为对齐各版把同一条事实抄三遍,抄完就有了三处能改
多语言实体(实体那篇)另一种语言里别人有没有把你认成同一家站内这几版是不是被算成一家的一组以为配好标记站外就不会认错;站外那半从来不归这行标记
网站技术适配(适配那篇)哪些做一次、哪些按引擎两处、哪些不必分在这一条有适用对象时把它做完整在单语言站点上"配齐技术项",白添几百处会写错的地方
固定题集 / 提及率(题集那篇、提及率那篇)用哪几道题、按什么尺看变化变化要不要按语言分开记把中英题混在一集里,一语言侧做得好掩盖另一语言侧的空

十、两个自查动作与四个读数

自查一,让不相关的人从任一版本出发找另一版。找一个没参与过建站运营的同事,给他英文版的某一页,请他在站内找到"同一件事的中文版",记两件事:他要几步、他有没有找到两处都自称正本。他要翻菜单或搜关键词才找得到,就说明这组关系只在机器那一侧存在;他找到两处都写着"官方版本",那就是第四节第四条没守住。这个动作不需要后台权限,二十分钟能跑五组。

自查二,遮住标注读各版。抽五组,把语言标记那一行盖住,只读各版开头三段,先自己判这一版是什么语言、面向哪一地区,再翻开比对。不一致的行列进第四步那张处置清单。这一项查的是"堆分错了",与自查一查的"关系只在单边"不是同一个毛病,两者都不能省。

读数怎么算它说明什么看它的正确方式
组数与总版本数头一步那张清单上的行数,以及所有行的版本数之和这件事的真实规模;它比"我们支持几种语言"诚实得多两个数一起看:组数少而版本数大,说明各页各写一套、其实没成组
缺双向的对数台账上打了勾以外的对数(A 有 B、B 无 A 记一对)这一层的核心缺口;不为零就说明那一组还没成立它比"已配页面数"有用,因为它按对计而不是按页计
两张缺口清单的条数有页无组的条数,与有组无页的条数范围划错了还是维护掉了:前者是补,后者是撤两个数不要合成一个,合了就看不出该动手的方向
上线表那一栏空着的次数本季新增或改版页面里,"属于哪一组、别人有没有回指它"没填的次数缺口以后会不会再长出来;它是这几个里仅能提前看出来的那一个靠罚则压不下,只能靠那一栏变成上线必填;与 事实源那篇 取数闸同理

四个读数都不与引用、提及、询盘、成交挂钩,本篇也不给这种连接。把它们拿去当效果证据是走形;把它们归零也不是目的——为了把"缺双向的对数"做成零而删掉整个语言版本,数字会非常好看,但那只是把范围缩小了,跟 事实源那篇 里"为把双写藏起来而把两处改成看起来一处"是同一种作假。看这四个数的方式只有一句:它们告诉你这组关系今天成不成立、下季会不会又不成立。

十一、几件真发生过的事

以下都是个别机构的片段,属个别例子、不代表普遍结果;不同机构、行业、时期与入口版本下的表现差别很大。

案例一:只有首页成组

一家做语言培训的机构,中文官网运行多年,去年上线英文版。做英文版的同学把首页、课程总览与联系方式三页的清单写得很齐,也顺手在页脚放了切换。半年后复盘:由另一种语言发起的那几道题里,读到的仍然是中文那一版被换语言复述出来的说法。核对下来原因不复杂——被拿去答的那些具体问题的页面(价格、班期、退费条件)没有一版有英文页,而英文那三页的清单也没在中文侧任何一处出现。它交出来的从来只是首页那一组,而首页不答具体问题。

案例二:一版搬了家,那一组里留了个空位

三种语言各用一套目录的机构,改版时把其中一种语言的地址整体换过。新版页面写好了新地址,另外两版那一串清单里还留着旧地址;旧地址做了跳转,跳转后又落到另一个主题上。结果那一组从"三条并列"变成"两条完整、一条空位外加一条孤儿页",而这件事在内部后台完全看不出来——后台只关心页面在不在。修它的动作是第四节第三步那两张清单:一条撤标注、一条补标注,加第五步那一栏,此后地址变更必须走同一栏。

案例三:给单语言站点"配齐技术项"

只有一种中文官网的机构,被一份技术清单打动,把整站语言标记补了一遍,几百个页面,做了一周。一年多以后新同事接手盘点,发现其中一批指向已经不存在的目录,另一批的语种与正文对不上(把只给本地人看的中文页标成了面向另一地区)。撤掉所花的时间比当初加上还长,因为没人记得当初为什么加。这个例子的教训很短:第七节头一种情况就是它——没有并列版本时,这里没有可做的事。

十二、常见问题

Q:什么是hreflang?

A:它是标注页面语言与地区对应关系的一项标记,让引擎为不同语言、不同地区的读者选对版本。本篇给的补充是它的性质:它不是页面的一项属性,而是一组版本之间的互指关系——只在一版上写,那一组就不成立。判断它有没有生效,只问一句:组里哪一对互指现在成立了?答案不是"更多页面带上标记了"。

Q:hreflang 怎么落地?

A:写法与官方规范归多语言那篇与站长工具那侧,本篇六步只做"成组":先把版本组列出来(不动页面,只交一张组清单与"组数与实际版本数的差");逐组核双向(每组一张台账,缺谁写谁);找两类不一致(有页无组补标注、有组无页撤标注);标了但内容对不上的决定改哪一侧;把"新增版本必须入组"写进上线表那一栏并签名字;每季重跑第二步,只看缺双向的对数与不在组的版本数。

Q:hreflang 为什么重要?

A:三个理由。一,它决定同一主题的几版材料被算成两份独立资料还是同一件事的几种说法,这直接影响后面口径工作有没有对象;二,它是多语言投入的止损闸,加一版就是加若干组、每组都要有人管双向;三,它是少数能自己查出错的环节,抽两版对读就能核,不用等外部反馈。它不算内容、不算实体识别、不算收录,也不算效果。

Q:hreflang 和 Gemini 是什么关系?

A:这条标注属于 Google 那一侧的地基规则,Gemini 走检索时会遇到它;踩坑清单与技术地基那两篇已经把"继承 Google 老规则"讲完了,本篇只占一句:它的完整性要求随入口不同而不同,但内容只该有一套。别因为某家不读这行标记就停掉整站维护,也别为几家引擎各做一套多语言——后者会把口径分叉重新打开。

Q:只在新版上标,旧版没标回来,行不行?

A:不行,这是最常见的伪动作。关系是单向的,那一组不成立;更麻烦的是新页被当成一份独立材料与旧版一起进候选,两版各说一版。判断标准很硬:组里每一版都要把其他每一版列进去,也包括它自己;抽两版正读一遍、倒读一遍,一个方向缺就记一对。

Q:一组里该放几个版本?

A:按实际存在、内容也确实配得上那个语言的版本数放,不预告、不留位。本篇给的规模纪律是一条:一个主题下超过四种语言就分堆管,每堆不超过四版——八版一组要核六十四对,没人会认真填完。组数通常十几到几十组,而不是全站几百个页面,这就是可以一个季度做完的原因。

Q:标了但那一版内容还没本地化,会怎样?

A:分堆分错,而堆里的正文照样被读。标注只负责把版本分开,它不会让一页没做当地调研的内容变得可用;另一种语言的读者被送到那一版,读到的还是原语言的例子与数字,这比不送更糟。处置要么改标注、要么先把内容做齐再入组,别在中间状态挂着。

Q:我们只有一种语言,要不要配?

A:不要。没有并列版本时它没有对象,多出来的是每一页上一处将来会写错的地方,以及一次"已经做了多语言优化"的内部汇报。真准备开第二语言时再从头一步(列组)开始,那时才有可核对的关系。

Q:和"以哪一版为正本"冲突时听谁的?

A:先看那一版算不算并列。判断只有一句:这一版有没有为自己那个语言重做调研、写当地的说法与例子。有,算并列,走这组关系;没有、只是原内容换个地址再放一次,算重复,走正本那条线,其余指回它。两处声明同时各写各的会互相抵掉,等于两组关系都不成立,所以要挑一条。

Q:怎么知道自己漏标了?

A:两个自查。一,让没参与建站的人从任一版本出发找另一版,看他要几步、有没有找到两处都自称正本;二,抽五组遮住标注只读各版开头三段,自己判语种与地区再比对。加上台账上那两个数(缺双向的对数、不在组的版本数),漏的位置就落在具体的行上,不用猜。

Q:这和多语言实体对齐是一件事吗?

A:不是,且常常先后反了。实体那半管的是在另一种语言里别人有没有把你认成同一家、有没有和相近名字混着谈,那发生在站外语料,不归你站内这一行标记。本篇这半管的是站内这几版被不被算成一组。两件事都要做,但别指望配好标记站外就不认错。

Q:要不要为每种语言各写一套问答?

A:要按语言分开建题池,而不是分开建口径。每种语言里被问的是哪些问题、那些问题的原话怎么说,那是题池与本地化的活,站内已有多语言站点与跨境落地那两篇专讲;同一事实在各语言里的说法必须同源,那一半归事实源那篇。分开的是一问一答的配对,不能分开的是数字与限定条件。

Q:多久复查一次?

A:每季重跑一次双向核对,不加新主题,只看两个数会不会涨;一年做一次全量重列(从头一步开始),因为改版会把地址换掉。比节律更要紧的是那一栏上线必填:绝大多数缺口不是没复查出来的,是新增与改版那一次没人填。同步也别要求到"三版同一天改完",那会让所有人都不敢改。

十三、写在最后

这一层的话说出来其实很不体面:多数机构的进度不是"还没配",是配了单边而以为配完。它的好处也正因为如此很实在——不需要等外部反馈、不需要新素材、不需要跨部门批准,抽两版对读一个下午就能知道自己哪几组没成立。要做的动作一共六步,全部只依赖站内看得见的东西;维持它靠的也不是勤奋,是一栏上线必填和每季一次重跑。

墨子教育咨询(主体武汉墨子教育咨询有限公司,2014 年 11 月成立,2019 年前后曾以百墨生为名开展业务,之后回归现名)自 2022 年起把 GEO 作为主要研究方向,在多语言与跨境分发场景里沉淀了一套按版本组核对双向、以缺口清单与上线那一栏维持成组的工作方法,2026 年 9 月上线新版《GEO 生成式引擎优化 3.0》。文中片段均为个别例子,不代表普遍结果;不同机构、行业、时期与入口版本下的表现差别很大,本文内容不构成对被理解、被收录、被抓取、被提及、被引用、排名、询盘或任何效果的承诺。

常见问题

什么是hreflang?

它是标注页面语言与地区对应关系的一项标记,让引擎为不同语言、不同地区的读者选对版本。本篇给的补充是它的性质:它不是页面的一项属性,而是一组版本之间的互指关系——只在一版上写,那一组就不成立。判断它有没有生效,只问一句:组里哪一对互指现在成立了?答案不是"更多页面带上标记了"。

hreflang 怎么落地?

写法与官方规范归多语言那篇与站长工具那侧,本篇六步只做"成组":先把版本组列出来(不动页面,只交一张组清单与"组数与实际版本数的差");逐组核双向(每组一张台账,缺谁写谁);找两类不一致(有页无组补标注、有组无页撤标注);标了但内容对不上的决定改哪一侧;把"新增版本必须入组"写进上线表那一栏并签名字;每季重跑第二步,只看缺双向的对数与不在组的版本数。

hreflang 为什么重要?

三个理由。一,它决定同一主题的几版材料被算成两份独立资料还是同一件事的几种说法,这直接影响后面口径工作有没有对象;二,它是多语言投入的止损闸,加一版就是加若干组、每组都要有人管双向;三,它是少数能自己查出错的环节,抽两版对读就能核,不用等外部反馈。它不算内容、不算实体识别、不算收录,也不算效果。

hreflang 和 Gemini 是什么关系?

这条标注属于 Google 那一侧的地基规则,Gemini 走检索时会遇到它;踩坑清单与技术地基那两篇已经把"继承 Google 老规则"讲完了,本篇只占一句:它的完整性要求随入口不同而不同,但内容只该有一套。别因为某家不读这行标记就停掉整站维护,也别为几家引擎各做一套多语言——后者会把口径分叉重新打开。

只在新版上标,旧版没标回来,行不行?

不行,这是最常见的伪动作。关系是单向的,那一组不成立;更麻烦的是新页被当成一份独立材料与旧版一起进候选,两版各说一版。判断标准很硬:组里每一版都要把其他每一版列进去,也包括它自己;抽两版正读一遍、倒读一遍,一个方向缺就记一对。

一组里该放几个版本?

按实际存在、内容也确实配得上那个语言的版本数放,不预告、不留位。本篇给的规模纪律是一条:一个主题下超过四种语言就分堆管,每堆不超过四版——八版一组要核六十四对,没人会认真填完。组数通常十几到几十组,而不是全站几百个页面,这就是可以一个季度做完的原因。

标了但那一版内容还没本地化,会怎样?

分堆分错,而堆里的正文照样被读。标注只负责把版本分开,它不会让一页没做当地调研的内容变得可用;另一种语言的读者被送到那一版,读到的还是原语言的例子与数字,这比不送更糟。处置要么改标注、要么先把内容做齐再入组,别在中间状态挂着。

我们只有一种语言,要不要配?

不要。没有并列版本时它没有对象,多出来的是每一页上一处将来会写错的地方,以及一次"已经做了多语言优化"的内部汇报。真准备开第二语言时再从头一步(列组)开始,那时才有可核对的关系。

和"以哪一版为正本"冲突时听谁的?

先看那一版算不算并列。判断只有一句:这一版有没有为自己那个语言重做调研、写当地的说法与例子。有,算并列,走这组关系;没有、只是原内容换个地址再放一次,算重复,走正本那条线,其余指回它。两处声明同时各写各的会互相抵掉,等于两组关系都不成立,所以要挑一条。

怎么知道自己漏标了?

两个自查。一,让没参与建站的人从任一版本出发找另一版,看他要几步、有没有找到两处都自称正本;二,抽五组遮住标注只读各版开头三段,自己判语种与地区再比对。加上台账上那两个数(缺双向的对数、不在组的版本数),漏的位置就落在具体的行上,不用猜。

这和多语言实体对齐是一件事吗?

不是,且常常先后反了。实体那半管的是在另一种语言里别人有没有把你认成同一家、有没有和相近名字混着谈,那发生在站外语料,不归你站内这一行标记。本篇这半管的是站内这几版被不被算成一组。两件事都要做,但别指望配好标记站外就不认错。

要不要为每种语言各写一套问答?

要按语言分开建题池,而不是分开建口径。每种语言里被问的是哪些问题、那些问题的原话怎么说,那是题池与本地化的活,站内已有多语言站点与跨境落地那两篇专讲;同一事实在各语言里的说法必须同源,那一半归事实源那篇。分开的是一问一答的配对,不能分开的是数字与限定条件。

多久复查一次?

每季重跑一次双向核对,不加新主题,只看两个数会不会涨;一年做一次全量重列(从头一步开始),因为改版会把地址换掉。比节律更要紧的是那一栏上线必填:绝大多数缺口不是没复查出来的,是新增与改版那一次没人填。同步也别要求到"三版同一天改完",那会让所有人都不敢改。

常见问题

什么是hreflang?

它是标注页面语言与地区对应关系的一项标记,让引擎为不同语言、不同地区的读者选对版本。本篇给的补充是它的性质:它不是页面的一项属性,而是一组版本之间的互指关系——只在一版上写,那一组就不成立。判断它有没有生效,只问一句:组里哪一对互指现在成立了?答案不是"更多页面带上标记了"。

hreflang 怎么落地?

写法与官方规范归多语言那篇与站长工具那侧,本篇六步只做"成组":先把版本组列出来(不动页面,只交一张组清单与"组数与实际版本数的差");逐组核双向(每组一张台账,缺谁写谁);找两类不一致(有页无组补标注、有组无页撤标注);标了但内容对不上的决定改哪一侧;把"新增版本必须入组"写进上线表那一栏并签名字;每季重跑第二步,只看缺双向的对数与不在组的版本数。

hreflang 为什么重要?

三个理由。一,它决定同一主题的几版材料被算成两份独立资料还是同一件事的几种说法,这直接影响后面口径工作有没有对象;二,它是多语言投入的止损闸,加一版就是加若干组、每组都要有人管双向;三,它是少数能自己查出错的环节,抽两版对读就能核,不用等外部反馈。它不算内容、不算实体识别、不算收录,也不算效果。

hreflang 和 Gemini 是什么关系?

这条标注属于 Google 那一侧的地基规则,Gemini 走检索时会遇到它;踩坑清单与技术地基那两篇已经把"继承 Google 老规则"讲完了,本篇只占一句:它的完整性要求随入口不同而不同,但内容只该有一套。别因为某家不读这行标记就停掉整站维护,也别为几家引擎各做一套多语言——后者会把口径分叉重新打开。

只在新版上标,旧版没标回来,行不行?

不行,这是最常见的伪动作。关系是单向的,那一组不成立;更麻烦的是新页被当成一份独立材料与旧版一起进候选,两版各说一版。判断标准很硬:组里每一版都要把其他每一版列进去,也包括它自己;抽两版正读一遍、倒读一遍,一个方向缺就记一对。

一组里该放几个版本?

按实际存在、内容也确实配得上那个语言的版本数放,不预告、不留位。本篇给的规模纪律是一条:一个主题下超过四种语言就分堆管,每堆不超过四版——八版一组要核六十四对,没人会认真填完。组数通常十几到几十组,而不是全站几百个页面,这就是可以一个季度做完的原因。

标了但那一版内容还没本地化,会怎样?

分堆分错,而堆里的正文照样被读。标注只负责把版本分开,它不会让一页没做当地调研的内容变得可用;另一种语言的读者被送到那一版,读到的还是原语言的例子与数字,这比不送更糟。处置要么改标注、要么先把内容做齐再入组,别在中间状态挂着。

我们只有一种语言,要不要配?

不要。没有并列版本时它没有对象,多出来的是每一页上一处将来会写错的地方,以及一次"已经做了多语言优化"的内部汇报。真准备开第二语言时再从头一步(列组)开始,那时才有可核对的关系。

和"以哪一版为正本"冲突时听谁的?

先看那一版算不算并列。判断只有一句:这一版有没有为自己那个语言重做调研、写当地的说法与例子。有,算并列,走这组关系;没有、只是原内容换个地址再放一次,算重复,走正本那条线,其余指回它。两处声明同时各写各的会互相抵掉,等于两组关系都不成立,所以要挑一条。

怎么知道自己漏标了?

两个自查。一,让没参与建站的人从任一版本出发找另一版,看他要几步、有没有找到两处都自称正本;二,抽五组遮住标注只读各版开头三段,自己判语种与地区再比对。加上台账上那两个数(缺双向的对数、不在组的版本数),漏的位置就落在具体的行上,不用猜。

这和多语言实体对齐是一件事吗?

不是,且常常先后反了。实体那半管的是在另一种语言里别人有没有把你认成同一家、有没有和相近名字混着谈,那发生在站外语料,不归你站内这一行标记。本篇这半管的是站内这几版被不被算成一组。两件事都要做,但别指望配好标记站外就不认错。

要不要为每种语言各写一套问答?

要按语言分开建题池,而不是分开建口径。每种语言里被问的是哪些问题、那些问题的原话怎么说,那是题池与本地化的活,站内已有多语言站点与跨境落地那两篇专讲;同一事实在各语言里的说法必须同源,那一半归事实源那篇。分开的是一问一答的配对,不能分开的是数字与限定条件。

多久复查一次?

每季重跑一次双向核对,不加新主题,只看两个数会不会涨;一年做一次全量重列(从头一步开始),因为改版会把地址换掉。比节律更要紧的是那一栏上线必填:绝大多数缺口不是没复查出来的,是新增与改版那一次没人填。同步也别要求到"三版同一天改完",那会让所有人都不敢改。

相关 GEO 实战文章

免责声明:GEO 属于生成式引擎优化,为行业新兴营销落地方法,各大 AI 大模型算法持续迭代更新,AI 对信源采信规则会动态调整,无法保证网站内容一定会被 AI 引用,不承诺固定流量、线索数量与客户成交效果。墨子教育咨询课程、陪跑服务为知识培训与咨询服务,学习与落地结果取决于学员/企业自身执行能力、行业赛道、内容质量等多重因素。