什么是站点地图?-墨子教育咨询

摘要:站点地图(sitemap)是一份列出站内页面地址与最后更新时间的名单文件,它降低机器发现页面的成本,却决定不了抓不抓、收不收录、引不引用。站内已经把它是清单不是门票、三份文件怎么配、抓不到怎么排查讲透了,本篇只占三件更靠名单本身的事:一是名单的三本账——条目账(该进的在不在,覆盖率是个能算的比值)、地址账(单上写的地址与线上真能点开的地址之间有四种对不上的错法,且都不报错)、时间账(更新时间那一栏有三种写法,各自会被读成完全不同的意思);二是名单作为活文档的治理——它由构建流程生成,改它的人通常不是用它的人,谁定生成规则、失真有哪三条信号、哪些事件后必须重验,这套责任从没落到纸面;三是名单与被问到之间隔着两跳,提交了不等于被读了,被读了不等于那一页能答对,两跳要分开核。另附六步落地、四种走形、分界表、两个核查与四个读数;与 DeepSeek 的关系落在:这一家没有回显,名单是降成本工具而不是信任来源,边际价值集中在新站、深层页与批量迁移之后这三处。文中片段均为个别例子、不代表普遍结果,不构成对被收录、被提及、被引用、排名、询盘或任何效果的承诺。

一、先把这词指的东西说准:它是一份名单,不是一次配置动作

站点地图(sitemap)这个词的日常用法是"那个文件配好了没有"。这句话把重点放在"配"上,实际上起作用的属性是另一个:它是一份会被反复重写的名单,而不是一次性设置项。名单的内容很朴素——你认为站内有哪些页面、每一页最后一次有实质变化是什么时候。机器拿到它,省掉自己顺着链接一点点摸的功夫。

这个说法听着小,但它决定了两件事。一是这东西的准确程度完全可以由你自己核对,不用等任何平台给回话:名单有几条、该在的在不在、地址点得开不开、时间栏是不是真的,四个问题全都能在站内回答完。二是它属于那种"平时没人看、一旦出事就先丢"的东西——改版、换域名、迁移、内容类型加新,名单都会跟着变,而没有人盯它。多数站上的名单不是被人写坏的,是被某一次发版顺手改坏之后半年没人发现。

站点地图、robots 与 llms 三份文件的分工
图一:三份机器要读的文件各管一段——名单管"你有哪些页",许可管"哪些能让进",说明管"该按什么理解你"。本篇只谈名单这本账,另两份的分工已在别处写清。

这个词条站内命中三十八篇,几处近邻先把分工说清:给站点地图祛魅那篇已经讲透了它的定位——它是清单不是门票,能降低被发现成本,却决定不了抓不抓、收不收录、引不引用,那篇还写了"提交了好久还没收录"怎么排查;技术三层分工那篇把许可、导览、可读三层各卡在哪张表摆完了;三文件配置清单那篇给的是上线前照着走的一遍,含优先级表与几个最容易踩的坑;机器抓不抓得到自查那篇讲的是三种"读不到"的成因——要登录、藏在一次点击之后、靠脚本现场生成只拿到空壳;可抓取那篇管三条判据与六种失败形状;结构化标注最小集合那篇管的是标注层,也就是"看见之后按什么理解你";收录那篇写了"没被收录"的四种真实含义;可发现性那篇则把"能被找到、会被找到、被当成谁找到"三层分开算账,并给了换问法、贴地址、换平台这三问定位法。这些篇把"它管不管用、和另外两份文件怎么分、上线时怎么配、抓不到怎么查"讲完了。中间少的是三件更靠名单本身的事:一是这本名单自己的三本账——条目账(该进的没进、不该进的挤进来,覆盖率其实是个能算的比值,多数团队从没算过)、地址账(单上写的地址和线上真能点开的那个地址,之间有四种对不上的错法)、时间账(更新时间那一栏有三种写法,各自会被读成完全不同的意思);二是名单作为活文档的治理——它由构建流程生成,改它的人通常不是用它的人,谁定生成规则、失真了有哪三条信号、哪些事件之后必须重验,这套责任从来没落到纸面;三是名单与"被问到"之间隔着两跳,两跳不能合并成一跳——提交了不等于被读了,被读了不等于那一页能答对。本篇只占这三层。

三条边界先划住:一,本篇不再论证名单有没有用、要不要神化它,那是祛魅那篇的活,本篇按"它有用但只在一段路上有用"这个前提往下走;二,本篇不讲 robots 与 llms 怎么写,也不讲标注层;三,本篇不讲收录与排名的排查顺序——查"为什么没被收录"另有专篇,本篇只把名单这本账查干净。

二、条目账:谁该在名单上、谁不该,覆盖率其实是个比值

"把所有页面都放进去"这句话听起来没有毛病,执行下去一定会出问题,因为站内页面的性质并不同一。先把五类页面按"进不进、为什么"分清。

表一:五类页面在名单里的位置——进不进、卡在什么判据上
页面类型该不该进判据(问一句就能定)常见做法与后果
能被单独问到的内容页必进"这页单独拿出来,能不能回答一个完整问题"漏掉这类页通常是构建脚本的规则没覆盖到新内容类型,属于静默漏,看不出报错
需要登录或付费才能看的页不进"不登录直接点开,能看到内容吗"放进去只会让机器抓到登录壳,白占条目并把可达率读数拉低
没有独立地址的模块(同页切换、弹层、锚点段)不进"这一小块有属于自己的地址吗"把它们当页面列进去,名单条目数虚高,实际那几行指向同一个地址
页面自己声明以别处为准的(规范化指向别的地址)不进"这页有没有告诉机器它只是另一个页的副本"留着不删,等于同一份内容在名单上占两三个位置,等于自己跟自己抢
批量生成的聚合页(标签页、筛选结果、站内搜索页)按数量决定"这一批里有多少是真人会来的,剩下的呢"全进是最常见的一种灌条目:条目数很好看,机器读到的是几千个高度重复的薄页

分完这五类,条目账才真正能算。算法不复杂,但要先有一个"期望值":覆盖率 = 名单上的内容页数 ÷ 你希望被答到的页面数。分母不是从名单里来的,是从期望表来的——你自己写一张表,按内容层列清楚"我希望在未来被问到时,答案会出自哪几页"。这张表多数团队没有,于是条目账就退化成"看条目数顺不顺眼"。

有了分子分母,漏与滥就成了两类不同的病。漏有三种形状:根本没生成(新加的内容类型没进构建脚本的取数规则,页在线上、名单里没有,这种漏最危险,因为它不出错、不报警);生成了但被过滤条件挡掉(规则里写着只取某几类,其余整体跳过);手动页没进自动产线(活动页、专题页靠人工建,产线不认识它们)。滥也有三种:参数副本(同一页带着不同来源标记各占一条)、站内搜索与筛选页批量入单、空页与占位页入单。漏会让盲区变大,滥会让名单本身失去可信度——一个团队发现名单里六成条目是薄页之后,通常连剩下四成也不再看。

名单的缺口核对表
图二:条目账的核对物是一张对表——左栏是期望被答到的页面,右栏是当期名单,中间的差额就是缺口。缺口按"没生成/被过滤/没进产线"分三格,三格的修法完全不同。

这里插一条实用规则:同一格内不要把三个地址写成三条。同一篇内容挂在带来源标记的地址、带尾斜杠的地址、以及一个旧地址上,是绝大多数站上的常态。名单里如果三条都在,你看上去的条目数比你真实的页面数多出一截,而这份虚高的账会被所有下游读数继承——你后面所有的"这季涨了多少"都建立在假分母上。改法在生成端:让构建脚本按页面自己声明的那个地址取数,而不是按访问路径取数。

三、地址账:名单上写的地址,和线上真能点开的那个,是两件事

名单里的每一条都是一个地址。地址这件事的坑不在"写没写",在"写的和线上真能点开的是不是同一个"。四种对不上的错法,按发现难度排。

表二:地址账的四种错法——长什么样、怎么被发现、改在哪一端
错法具体样子它会造成什么现象改在哪一端
协议前缀写旧的那一版单上是非加密前缀,线上其实是加密那一版(或者反过来两条都能打开)同一份内容在下游被当成两处,权重与提及各算一半;名单里出现成对的近似条目生成端统一按线上实际在用的那一版输出,不要手改单里的条目
尾斜杠与大小写不一致同一地址,一个带斜杠一个不带,一个全小写一个带大写条目数虚高;抽样可达率看着正常,覆盖率却总对不上规则里定一种写法并全站统一,别指望机器替你合并
带来源参数的副本入单地址后面挂着来源标记参数,参数不同各算一条名单条目数远大于内容页数;同一页在不同引擎被当成不同页面提及生成时剥掉来源参数,只留本体地址
页面自己声明以别处为准,名单还留着它那条地址能点开、返回正常,但页面内部写着"以另一地址为正本"机器按名单进来,读到一半被转到别处;这一条永远不会被当成独立页处理让生成规则读页面自己的声明,被指为副本的条目直接不出单

四种错法有一个共同点:都不会报错。地址点得开、文件语法没问题、平台那边也不给你任何提示,所以这四种错全都能长期存在而不被发现。这就是为什么地址账的核对方式必须是"自己抽、自己点":任取二十条,逐条直接请求,看返回码,看最终落地的地址和单上写的是否同一个字符串。这一步不用任何平台的后台,半小时能做完,产出一行结论——"抽样二十条,几条原样返回、几条被转走、几条打不开"。

还有一种更隐蔽的:名单是新的,页还没上。构建与部署不同步时会出现"单里已有、线上打不开"的条目——这不是地址写错,是名单跑到了内容前面。它和"页在线、名单没有"是相反方向的两种失真,现象也相反:前者会让打不开的条目堆积,后者会让覆盖率长期不到一成而没人解释。两者都要靠同一样实物发现——季度名单快照与当期线上页面数对一遍。

四、时间账,以及这本名单归谁管

名单里除了地址,还带一个"最后更新"字段。这个字段是整本名单里最容易被乱写、也最容易被机器反过来用的一栏。三种写法,读出来的意思完全不同。

表三:更新时间那一栏的三种写法,和机器从每种写法里读出什么
写法怎么产生的下游读到的意思代价
全同一时间每次构建把整本重跑一遍,所有条目盖当天时间"这站全站同一天换了遍内容"——一次刷几百条相同时间,等于没提供任何区分信息真正改过的页被埋在假时间里,机器没法判断该优先回来看哪几页
整栏空白或干脆不输出生成规则没取这个字段,或取不到就留空"这站不告诉我变化"—回访节奏只能靠猜,通常猜得比你希望的更懒新改的关键页得不到及时回访,改动扩散变慢
按实质编辑时间输出取内容真正被改的那一次,改一次才动一次"这页什么时候变过"——这是这栏被设计出来要回答的那个问题需要生成端接上内容的编辑记录,多数团队卡在这里没接

一条判断规则够用了:只有内容实质变化才动时间。改样式、换插图、调整页面顺序不算;改价格、改班期、改地址、改结论算。把这栏刷成当天时间,短期看像"活跃",长期是让这栏彻底失去信息量——一台一直报"刚刚更新"的机器,和一台不报的机器,提供的信息是一样的。

时间账之后,接着是这本名单的归属问题,而这是本篇最想推进一步的地方。名单不是有人"写"出来的,是构建流程"生成"出来的。这句话的实际含义是:改它的人通常不是用它的人。用名单的人(做内容、做优化的那位)没有权限改它,也没有动力定期看它;能改它的人(发版的那位)不知道它为什么重要,只会在校验报错时才看一眼。中间那块没人负责的地带,就是名单长期失真的地方——不是有人写错了,是没人知道自己该看一眼。

治理层的实物不需要多重,三件事写在一页纸上就够:一,生成规则谁定——新加内容类型时,把这类页面加进出单规则这个动作归谁;二,谁在发版后验——不是验语法,是验条目数与上次比变化是否合理解释;三,失真了谁修——发现覆盖率掉了、打不开的条目堆了,改的是规则还是页面。三条里最要紧的是头一条,因为它对应的是最常见的失真方式:安静地漏。

一个团队手上有好几处阵地,各自有一份名单或根本没有
图三:一个团队通常同时管着几处阵地——自己的站、平台上的主页、第三方登记处。每处阵地的"名单"形态不同:自建站是真名单,平台主页是平台内部的目录,第三方处根本没有名单这一层。先把阵地分清,再谈名单这本账归谁。

三条失真信号,都是不用工具就能看见的:条目数骤变(比上一季少一大截或多一大截,而你自己说不出原因)、更新时间全同(抽十条看,时间戳都一样)、新页迟迟不上单(明知上周发了四篇,名单里找不到)。任意一条成立,就先不要碰平台后台,回到生成规则那头看。四类事件之后必须重验,不看频率看事件:改版或换模板、迁移或换域名(这两类会同时打穿地址账与条目账)、新增内容类型(最容易静默漏的一刻)、批量删页与合并(名单里会留一堆打不开的旧条目)。这一套的落点是一句规则:改生成规则的人才算改了名单,手改单里的某一条会在下一次构建时被冲掉——这也是为什么很多团队"明明改过"却毫无效果。

五、站点地图 怎么落地:六步,每步留一件实物

下面六步是按"先自洽、再对外"的顺序排的。前五步完全不涉及任何平台,做完你手上会有五件实物;第六步才开始谈提交与观察。

头一步:写期望表。按内容层列出你希望被答到的页面,每一行写三样——这页回答哪一类问题、它属于哪个内容层、它现在有没有独立地址。这张表是后面所有比值的分母,也是本篇里最费时间但最省事的一件东西。实物:期望页面表。

第二步:拿当期名单和期望表对。名单从线上直接取,别从后台缓存里取。逐行核对,差额按三格分类:没生成、被过滤、没进产线。实物:缺口清单(哪几类页面整类不在单上,一眼能看出来)。

第三步:抽二十条做地址核对。逐条请求,记三个数:原样返回几条、被转走到别处几条、打不开几条。打不开的那几条单独列出来看是不是名单跑到了内容前面。实物:地址抽样表。

第四步:验时间栏的真实度。随机抽十条,对照后台的编辑记录,看这栏写的是不是那次真改动。十条里超过七条对不上,说明这栏是构建时间,改的是生成规则不是内容。实物:一行结论,写清"这栏目前记录的是什么"。

第五步:把归口写下来。生成规则谁定、发版后谁验、失真谁修,三条各写一个岗位名(不用写人名,写岗位,避免人员流动后归口消失)。同时把四类必须重验的事件接进流程检查项里。实物:名单归口说明(一页纸)。

第六步:定最低复查频率,并把三本账记成台账。频率不由你希望多勤决定,由你跑得动的最低值决定——多数团队定季度是稳的。每期只记四个数:条目数、覆盖率、抽样可达、时间栏真实度。实物:季度名单快照(把当期名单文件本身存一份,别只存截图,下期比对要用原文)。

六、站点地图 为什么重要:三个理由,以及它不算什么

先给三个理由,三个理由都不是"它能带来收录"。

理由一:它是入口层里少数能自己完整核对的东西。抓取通不通、渲染对不对、别家怎么解读你,这些都要等平台回话或者根本没有回话;而名单有几条、该在的在不在、地址点不点得开、时间栏真不真,四个问题全部能在站内自答。对一个只有一个人兼着做优化的团队,这种"不用求人就能查"的东西值得优先做,因为它不会被排到别人的日程上。

理由二:它是迁移与改版时最容易一次性丢光的资产。换域名、改版、合并内容这几件事里,名单是仅有的一处"错了会同时影响所有页面"的单点。它本身不值钱,但它是那几件事之后最先能看出问题的仪表——迁移完成当天条目数掉了三成,不用等任何平台告诉你,你已经知道有问题。

理由三:它逼你把"站内到底有多少页"这件事变成有数的东西。多数团队答不出"你现在线上有多少个可被单独问到的页面"。做期望表的过程中一定会撞上这个问题,而它恰好是所有下游工作(内容覆盖、信源建设、提问集分母)都要用的那个数。名单这本账做扎实,等于顺手把家底盘出来了。

再说它不算什么,这一头要说得比上一头硬。它不决定采信——名单里有一条,不代表那一页会被当成可靠来源;它不改变被怎么说——你被答成什么样由页面内容、口径与外部提及决定,名单连内容都不读;它不是收录的原因——它是降低发现成本的东西,把发现当成因果链的头一环没错,把它当成通行证就是自欺。这三条在祛魅那篇里讲得更多,本篇只把它们当既定前提。真正会改变结果的,是名单之后那几层的工作。信源建设那篇与AI 爬虫那篇分别管"外部有哪些地方会替你说话"和"谁真的会来读你",那两处才是被说到、被引用的主战场;名单的工作只是别让该被读到的页面因为一个假地址而读不到。

七、站点地图 和 DeepSeek 是什么关系:四格,各自独立

这一题日常被问成一个是非题——"要不要给 DeepSeek 提交 sitemap"。它其实拆成四件不同的事,混着答一定会答歪。四格按"谁在这格上做决定"排。

表四:站点地图 与 DeepSeek 之间的四格——每格问法不同、能做的事不同
格这一格实际在问什么你这边能做的做不到的
读没读到这份名单它有没有来取过这本名单、取了之后有没有按名单来回访保证名单本身可达(点开就是一份合法名单)、条目准确、时间栏可信没有回显。提交与否、读与否,你无从直接确认,只能从结果侧倒推
读到之后拿它干什么名单是发现线索,还是内容候选来源让该被看到的页面出现在名单上,尤其是新站、深层页、批量迁移后的那一批名单不含正文,它不可能改变"你被说成什么样";那一头在页面与外部提及
标注层与名单的分工它按什么结构化理解你这页名单管"有没有这一页",标注管"这一页被归成哪一类、字段是什么"不要用名单补标注的缺,也不要用标注补名单的缺,两层的缺各修各的
答错时名单担不担责那一页已经在线、也在名单上、答案里却把你写错了确认那页的口径、生效期与外部一致——这是内容层的事名单在这格里不承担责任,重提交一遍不会改变任何字

四格合起来给一句判断:对这一家,名单是降成本工具,不是信任来源。它的边际价值集中在三处——新站(几乎没有内部链接可以顺着摸)、深层页(藏在三四层之后、外部也没人提)、批量迁移或改版之后(旧路径整批失效,名单是当下能给出新路径的仅有的一件东西)。这三处之外的页面,加进名单与不加,看不出区别;而多数团队的名单恰恰在为新站做努力、为老站做表演——把绝大部分已经稳定的页面反复入单、反复提交,用来代替真正该做的内容层工作。

同一份名单在不同平台面前被读成不同的事
图四:一份名单、几处读者。传统搜索有提交入口与抓取统计,能给你半个回音;生成式问答这一侧多半没有回显,只能用"那一页被问到时有没有出现"来倒推。两类读者的验证方式不同,不能用一边的结果替另一边交差。

还有一个常被误传的点:这一家没有统一的"提交"入口不等于名单无用。名单是自上而下摆在固定路径上的文件,任何程序按约定路径来取都能取到,这件事不依赖你有没有在哪个后台填过地址。反过来说,你在某个后台填过一次,也不代表另一处会顺带来读。两件事不要互相替补。网站技术适配那篇里讲过按引擎分层的做法——名单属于"全站做一次、不必分引擎"那一层,写一份给所有人读是对的,为每家单独做一份是多余的工;多语言与多地区站另有属性层要处理,那是另一个词条的事(见 hreflang 那篇)。

八、四种走形:都像在做事,实际各坏在不同处

走形一:上线时勾掉,此后不管。名单在配置检查表上是一项,勾完就翻篇。它的内容随构建流程天天变,而检查表不会再看它。这种走形的表现不是立刻出问题,而是在某一次改版之后覆盖率掉到两三成,而所有人以为是"算法变了"。修法是把它从配置项改成资产项——资产要有归口、要有复查频率、要有上一期的快照可比。

走形二:把条目数当成绩。"我们的 sitemap 里有八千条"这句话被当成一件好事说出来。名单条目数与站内的真实内容页数差多远,取决于灌了多少薄页与参数副本。把条目数当考核指标的团队会去做批量聚合页入单,结果名单变得更长、更不可信,同时真正该在单上的十几篇核心页可能一条都不在。这一种比空着更糟——它给出一个"技术层已经做了"的画面。

走形三:单上有、页里没有。名单跑到了部署前面。常见于两类场景:一是构建产物被直接推上名单而页面还在审核或还没发布;二是删页与合并只改了内容,生成规则里的取数条件没改,旧条目留在单上。表现是打不开的条目稳定堆积,且每次都换一批——因为构建每天都在重写。修法是让生成时刻与发布状态绑定,未发布不进单。

走形四:提交完就等。把两跳当一跳。提交了名单,然后开始等"收录起来、引用起来",把名单之后没有任何动作的这段时间当成产出。这一种的问题不是错,而是错的时间分配:名单这一层做到自洽只要几天,之后的功夫全在内容与信源;把等待期用来再做一遍名单,就是把同一件事做了两遍而没做下一件。判据很简单——你这次改的是名单还是页面;只改了名单的话,这一轮该结束了。

九、七件东西别混在一起:一张分界表

名单最容易和另外六件东西被并到一句"技术上做完了"里。分界的问法统一成一句:这件事是在决定"有没有这一页",还是在决定"这一页能不能被读、被读成什么"。前一半归名单,后一半不归。

表五:名单与相邻六件事的分界——各管哪一段、用什么问法分开
相邻的东西它管的那一段名单管的那一段分开用的问法
robots(许可文件)哪些路径允许来读、哪些不许有哪些页"是在争该不该让它读,还是在争这页存不存在"
llms(写给模型的说明)该按什么顺序与口径理解你不涉口径,只列地址"是在解释站点,还是在报页面清单"
结构化标注(Schema)这一页被归成哪一类、字段是什么让那一页被发现得到"缺的是条目还是字段"
可抓取那篇说的状态点开能不能读到正文(含渲染与登录墙)这条地址有没有被列出来"是没列上,还是列上了读不到"
收录那篇说的结果页面有没有进了别人的库你这一侧有没有把页报全"是在查对方库里的状态,还是在查自己单上的完整性"
可发现性那篇说的三层能被找到、会被找到、被当成谁找到只贡献"会被找到"里的一小段"是在补通路数量,还是在补这份名单"
提交动作本身让某一家知道去哪儿取取到的是什么"是没告诉它,还是告诉了但给错了"

这张表里最容易被合并的是头一栏与第四栏:许可文件把某段路径挡了,名单还照常把那批页面列着——两件事各自"正确",合起来是零。遇到这种冲突,以许可为准,名单里的条目只是白列。冲突不会报错,这是名单和许可之间最典型的失效形状。另一组常被合并的是第三栏与标注层:有人在名单里塞进几十个字段来"帮机器理解",那份文件既不是合格的名单也不是合格的标注,两头都不认。各归各的位置,是最省事的修法。

十、两个自己就能做的核查,加四个不合并的读数

这两个核查都不用任何平台账号,也不用等回话,一个下午能全做完;它们的产出是"改哪一条规则",不是评价这份名单好不好。

核查一:把名单和线上真有的页面对一遍,只看差额往哪边偏

取当期名单,数出内容页数(把聚合页、参数副本、登录页先剔掉);再从站内侧数一次"线上可被单独问到的页面"有多少。两个数一比,三种结果各对应不同动作:名单明显少——生成规则的取数范围落后于内容实际,去看新加的内容类型;名单明显多——灌了薄页或留着死条目,去收紧规则与删页联动;两数接近但都有对不上的具体页——问题在个别页面的状态(未发布、被挡、被指为副本),逐页查而不是改规则。多数团队卡在头一种与第三种混着出现,所以差额要按类别拆开看,不能只看一个总差。

核查二:随机抽二十条,逐条点开并比对落地地址

只记三个数:原样返回几条、被转到别处几条、打不开几条。二十条不需要统计学意义,它的任务是让你看见"名单里的地址是不是都真的能用"。被转走那几条要看转去的是不是同一个页面——如果是同一内容的另一写法,说明地址账里的四种错法你中了至少一种;打不开那几条要看是不是名单跑在发布前面。这一核查每季做一次、每次半小时,是整篇里性价比最高的一个动作,因为它同时覆盖条目、地址、时间三本账中最容易坏的两本。

名单三本账的季度核查表
图五:季度核查的实物就是一张三行表——覆盖率、抽样可达、时间栏真实度,各记一个数与一句结论。三个数不许合成一个总分,因为它们各自会指向不同的修法:改取数规则、改地址写法、改时间取值。
表六:四个可以记的读数——各自回答什么、不许被拿来做什么
读数怎么取它回答的问题不许拿它做什么
条目数名单里的地址总数(剔掉非内容页后另记一列)这本名单在体量上发生了什么变化当成绩汇报;用它替代覆盖率
覆盖率名单上的内容页数 ÷ 期望表页数该报的报全了没有反过来当"做得好"的证据——分母是你自己写的,它只能暴露缺口
抽样可达率抽二十条,原样返回的条数占比单上写的地址是不是真的能用外推成全站结论;它只说明这一批抽样
时间栏真实度抽十条比对编辑记录,对得上的条数那一栏现在记录的是编辑时间还是构建时间当成内容质量的替身;它只说明字段有没有接对

四个数不许合并,也不许只留一个。合并之后你会得到"名单健康度 82 分"这种没法派活的结论;只留条目数则会稳定地把动作推向灌条目。四个数各改各的:覆盖率掉了改取数规则,可达率掉了改地址写法或发布联动,真实度掉了改时间取值,条目数只用来做异常预警(骤变必有事故)。

十一、几件真发生过的事

下面三段是个别团队在不同时期的具体经过,只作形状参考,不代表普遍结果。

一件迁站后才发现的整类漏。一个做成人培训的机构在年初把内容从二级目录迁到独立域名,旧站的名单原样搬过来只改了前缀。迁移当天条目数没变,他们以为一切正常。三个月后回头看,新域名的名单里全部是旧结构条目,新路径一条没有——原因是生成脚本按配置文件里的目录模板取数,而那次迁移没有更新那份配置。发现它的契机很偶然:有人手动往名单里加了一条新页,构建被覆盖,加进去的条目第二天消失了,才有人去看生成端。那一次真正损失的不是名单,是三个月的新内容窗口,而名单文件每天都好端端地摆在那个路径上,语法完全合法。

一次把条目数当成绩的复盘。一个几百页的知识站,把标签页与站内搜索结果全部纳入名单,条目数从八百涨到六千,团队内部把它当成"技术层做完了"的证据汇报。半年后做一次核查二的抽样,二十条里有十一条指向同一内容的不同参数写法,真正的内容页反而抽中不到三条。那一次改了生成规则的三条取数条件,条目数回落到九百,而当期被问到时能答上的页面数不降反升——因为假地址不再互相抵消。这个例子的重点不是"条目少更好",而是名单里每一条都要对应一个真正不同的页面。

一个把时间栏刷新的例子。一个班期敏感的机构,为让站点"看起来活跃",把全站更新时间在每次发布时统一刷成当天。结果是那一栏连续几期全同,真正改了班期的两三页和三年前就没动的页面长得一模一样。他们后来做的调整很小:只有班期、价格、地址三类字段真变动的页面才更新时间,其余不动。三个月后的差别不在流量上,而在旧话出现的频率——改了的那几页,被答成旧班期的次数肉眼可见地少了。这个观察只在他们站内成立过一次,不足以当作规律,但它说明时间栏不是活跃度信号,是差异信号;把它刷成一片相同,等于自己把这栏关掉。

十二、常见问题

Q:什么是站点地图?

A:站点地图(sitemap)是一份列出站内页面地址及其最后更新时间的名单文件,摆在固定路径上,供搜索引擎与各类爬虫按约定取用。它解决的是"你有哪些页、各页什么时候变过"这两件事,降低机器自己顺链接摸索的发现成本。本篇把它当一件资产而不是一个配置项来讲:名单本身有三本账——条目账(该进的在不在)、地址账(写的和线上是不是同一个)、时间账(那一栏记的是不是真改动),三本账都能在站内自己核对完,不依赖任何平台回话。

Q:站点地图 怎么落地?

A:按"先自洽、再对外"的六步走,每步留一件实物。一,写期望表——列出你希望被答到的页面,这是所有比值的分母;二,拿当期名单和期望表对缺口,差额按没生成、被过滤、没进产线分三格;三,抽二十条做地址核对,记原样返回、被转走、打不开各几条;四,验更新时间栏的真实度,抽十条比对编辑记录;五,把归口写成一张纸——生成规则谁定、发版后谁验、失真谁修;六,定你跑得动的最低复查频率(多数团队定季度),每期记四个数并存一份名单原文快照。前五步完全不涉及任何平台。

Q:站点地图 为什么重要?

A:三个理由都不是"它能带来收录"。一,它是入口层里少数能自己完整核对的东西,不用求人、不用等回话,适合人手少的团队先做;二,它是迁移与改版时最容易一次性丢光的单点资产,也是那几件事之后最先能看出问题的仪表;三,做期望表会逼你回答"线上到底有多少个可被单独问到的页面",这个数是内容覆盖、信源建设、提问集分母都要用的底数。同时要认清它不算什么:不决定采信、不改变被怎么说、不是收录的原因。

Q:站点地图 和 DeepSeek 是什么关系?

A:拆成四格看,别问成一个是非题。头一格,它有没有来取这份名单——没有回显,只能从结果侧倒推;第二格,取到之后拿它干什么——名单是发现线索,不含正文,改变不了你被说成什么样;第三格,与标注层的分工——名单管"有没有这一页",标注管"这一页被归成哪一类",两层的缺各修各的;第四格,答错时名单不担责——那页在线也在单上而答案写错了,重提交一遍不会改变任何字。合起来一句:对这一家,名单是降成本工具,不是信任来源,它的边际价值集中在新站、深层页与批量迁移之后这三处。

Q:名单要放多少条?全站都放吗?

A:不按条数定,按页面性质定。能被单独拿出来回答一个完整问题的内容页必进;需要登录才能看的、没有独立地址的、页面自己声明以别处为准的,都不进;批量生成的标签页、筛选页、站内搜索页按"这一批里有多少是真人会来的"来卡数量。判断名单好坏的从来不是条目数,是覆盖率——单上的内容页数除以期望被答到的页面数。分母是你自己那张期望表,不是名单。

Q:更新时间那一栏要不要每次全刷成最新?

A:不要。全刷之后所有条目时间相同,这一栏的信息量归零——机器无法判断该优先回来看哪几页,你和"根本没写这栏"得到的是同一个结果。规则是只有内容实质变化才动时间:改班期、改价格、改地址、改结论算,改样式、换插图、调顺序不算。抽十条里有七条以上对不上真实编辑记录,说明这一栏目前记的是构建时间,要改的是生成规则,不是内容。

Q:提交了多久会有效果?

A:这个问题预设了一条确定的因果时间线,而名单这一段本来就没有可承诺的时间。它能改变的是机器发现你页面的成本,而发现之后还有读、收、检、引好几段,每一段都由别的东西决定。合理的做法不是等一个周期看结果,而是把名单做到自洽之后就把功夫转到内容与信源那两层。判据一句话:这一轮你改的是名单还是页面,只改了名单的话,这一轮就该结束了。

Q:名单和 robots 冲突了以谁为准?

A:以许可为准。许可文件把某段路径挡在外面,名单里那些条目就只是白列——机器按约定读到许可是"不许",就不会进。这种冲突不会报错,是名单与许可之间最典型的失效形状:两件事各自看着都"正确",合起来是零。修法也是两头一起改:要么放开许可,要么把被挡的那批条目从名单里去掉,别留着互相矛盾。

Q:没被收录是不是名单的问题?

A:名单只是候选原因里的一格,而且是最好排的一格。先看这条地址在不在单上、点开能不能读到正文,两个问题当场有答案。在单上且能读到,问题就不在名单,要往下几段查——内容本身是否回答了问题、是否与外部说法一致、是否进了别人的库。"没被收录"至少有四种真实含义,别把它们都算到名单头上,那会掩盖真正要修的那一层。

Q:需要给每一家引擎都提交吗?

A:不必,也做不到。名单是摆在固定路径上的公开文件,按约定路径来取的程序都能读到,这件事不依赖你在哪家后台填过地址。有提交入口的传统平台值得填一次;生成式问答这一侧多数没有统一入口,也不需要你为每家单独做一份名单——写一份给所有人读是对的,为每家做一份是多余的工。真正需要分开对待的是验证方式,不是文件本身。

Q:改了名单怎么知道有没有用?

A:分两跳看,别合。头一跳是名单自洽度,改完立刻能测:覆盖率、抽样可达、时间栏真实度,四个数当场对比上一期,这一跳的结果由你自己负责、也看得见。第二跳是那一页被问到时有没有出现、有没有答对,这一跳受内容与外部提及影响,不是名单的功劳也不是名单的过错。把两跳合起来看的人,会既在没用时误改名单,也在有用时误信名单。

Q:平台号、第三方页面要不要进这份名单?

A:不进。名单只管你自己域名下的页面。平台上的主页、账号内容、第三方登记处的信息各自受平台内部目录与规则支配,那里没有"你的名单"这一层。它们该被算进的是另一本账——你在几处阵地有可被读到的表述、各处说法是否一致。先把阵地分清,再谈各阵地该做什么,不要把不属于名单的东西塞进名单。

Q:这套东西做到哪一步算完成?

A:完成线不是一次配置,是一套能持续发现失真的机制。具体三件:三本账各有一句当期结论(缺口在哪一类、抽样可达几条、时间栏记的是什么);归口一张纸写清三个岗位;复查频率定在你跑得动的最低值并且跑过一期、留下快照可比。做到这三件就可以收手,之后每季只花半小时。名单永远不会有"做完"的那一天,它只有"有人看着"和"没人看着"两种状态。

十三、写在最后:它是一份名单,所以像管名单那样管它

关于站点地图,市面上要么把它说成通行证,要么把它说成废物,两种说法都在替别人省事。它其实就是一份名单:列得全不全、地址真不真、时间准不准,三个问题都有站内自查的答案;名单之外的事情——那一页写了什么、外面有多少地方替你说过话、被问到时以什么口径出现——一件都不归它管。把这三本账做扎实,然后把注意力挪走,是这篇想给的仅有的一条建议动作。

更值得多花功夫的是名单之后的那两层:一页内容到底能不能被单独问到时答对,取决于你自己有没有把口径写死;而它在多处阵地上的说法是否一致,取决于信源那头有没有人跟。这两件做不好,名单做到满分也只是让机器更快读到一份含混的表述。

墨子教育咨询(主体武汉墨子教育咨询有限公司,2014 年 11 月成立,2019 年前后曾以百墨生为名开展业务,之后回归现名)自 2022 年起把 GEO 作为主要研究方向,围绕生成式引擎的收录、结构化、信源与引用做了长期整理与实操记录,本站内的百科词条与常见问题均出于这套积累。本文所述三本账、六步落地与四个读数均为方法论说明,文中片段均为个别例子、不代表普遍结果,不构成对被理解、被收录、被提及、被引用、排名、询盘或任何效果的承诺;名单的具体规则以你所用构建工具与当期各家公开说明为准,如与当期说明不一致,以当期说明为准。

常见问题

什么是站点地图?

站点地图(sitemap)是一份列出站内页面地址及其最后更新时间的名单文件,摆在固定路径上,供搜索引擎与各类爬虫按约定取用。它解决的是"你有哪些页、各页什么时候变过"这两件事,降低机器自己顺链接摸索的发现成本。本篇把它当一件资产而不是一个配置项来讲:名单本身有三本账——条目账(该进的在不在)、地址账(写的和线上是不是同一个)、时间账(那一栏记的是不是真改动),三本账都能在站内自己核对完,不依赖任何平台回话。

站点地图 怎么落地?

按"先自洽、再对外"的六步走,每步留一件实物。一,写期望表——列出你希望被答到的页面,这是所有比值的分母;二,拿当期名单和期望表对缺口,差额按没生成、被过滤、没进产线分三格;三,抽二十条做地址核对,记原样返回、被转走、打不开各几条;四,验更新时间栏的真实度,抽十条比对编辑记录;五,把归口写成一张纸——生成规则谁定、发版后谁验、失真谁修;六,定你跑得动的最低复查频率(多数团队定季度),每期记四个数并存一份名单原文快照。前五步完全不涉及任何平台。

站点地图 为什么重要?

三个理由都不是"它能带来收录"。一,它是入口层里少数能自己完整核对的东西,不用求人、不用等回话,适合人手少的团队先做;二,它是迁移与改版时最容易一次性丢光的单点资产,也是那几件事之后最先能看出问题的仪表;三,做期望表会逼你回答"线上到底有多少个可被单独问到的页面",这个数是内容覆盖、信源建设、提问集分母都要用的底数。同时要认清它不算什么:不决定采信、不改变被怎么说、不是收录的原因。

站点地图 和 DeepSeek 是什么关系?

拆成四格看,别问成一个是非题。头一格,它有没有来取这份名单——没有回显,只能从结果侧倒推;第二格,取到之后拿它干什么——名单是发现线索,不含正文,改变不了你被说成什么样;第三格,与标注层的分工——名单管"有没有这一页",标注管"这一页被归成哪一类",两层的缺各修各的;第四格,答错时名单不担责——那页在线也在单上而答案写错了,重提交一遍不会改变任何字。合起来一句:对这一家,名单是降成本工具,不是信任来源,它的边际价值集中在新站、深层页与批量迁移之后这三处。

名单要放多少条?全站都放吗?

不按条数定,按页面性质定。能被单独拿出来回答一个完整问题的内容页必进;需要登录才能看的、没有独立地址的、页面自己声明以别处为准的,都不进;批量生成的标签页、筛选页、站内搜索页按"这一批里有多少是真人会来的"来卡数量。判断名单好坏的从来不是条目数,是覆盖率——单上的内容页数除以期望被答到的页面数。分母是你自己那张期望表,不是名单。

更新时间那一栏要不要每次全刷成最新?

不要。全刷之后所有条目时间相同,这一栏的信息量归零——机器无法判断该优先回来看哪几页,你和"根本没写这栏"得到的是同一个结果。规则是只有内容实质变化才动时间:改班期、改价格、改地址、改结论算,改样式、换插图、调顺序不算。抽十条里有七条以上对不上真实编辑记录,说明这一栏目前记的是构建时间,要改的是生成规则,不是内容。

提交了多久会有效果?

这个问题预设了一条确定的因果时间线,而名单这一段本来就没有可承诺的时间。它能改变的是机器发现你页面的成本,而发现之后还有读、收、检、引好几段,每一段都由别的东西决定。合理的做法不是等一个周期看结果,而是把名单做到自洽之后就把功夫转到内容与信源那两层。判据一句话:这一轮你改的是名单还是页面,只改了名单的话,这一轮就该结束了。

名单和 robots 冲突了以谁为准?

以许可为准。许可文件把某段路径挡在外面,名单里那些条目就只是白列——机器按约定读到许可是"不许",就不会进。这种冲突不会报错,是名单与许可之间最典型的失效形状:两件事各自看着都"正确",合起来是零。修法也是两头一起改:要么放开许可,要么把被挡的那批条目从名单里去掉,别留着互相矛盾。

没被收录是不是名单的问题?

名单只是候选原因里的一格,而且是最好排的一格。先看这条地址在不在单上、点开能不能读到正文,两个问题当场有答案。在单上且能读到,问题就不在名单,要往下几段查——内容本身是否回答了问题、是否与外部说法一致、是否进了别人的库。"没被收录"至少有四种真实含义,别把它们都算到名单头上,那会掩盖真正要修的那一层。

需要给每一家引擎都提交吗?

不必,也做不到。名单是摆在固定路径上的公开文件,按约定路径来取的程序都能读到,这件事不依赖你在哪家后台填过地址。有提交入口的传统平台值得填一次;生成式问答这一侧多数没有统一入口,也不需要你为每家单独做一份名单——写一份给所有人读是对的,为每家做一份是多余的工。真正需要分开对待的是验证方式,不是文件本身。

改了名单怎么知道有没有用?

分两跳看,别合。头一跳是名单自洽度,改完立刻能测:覆盖率、抽样可达、时间栏真实度,四个数当场对比上一期,这一跳的结果由你自己负责、也看得见。第二跳是那一页被问到时有没有出现、有没有答对,这一跳受内容与外部提及影响,不是名单的功劳也不是名单的过错。把两跳合起来看的人,会既在没用时误改名单,也在有用时误信名单。

平台号、第三方页面要不要进这份名单?

不进。名单只管你自己域名下的页面。平台上的主页、账号内容、第三方登记处的信息各自受平台内部目录与规则支配,那里没有"你的名单"这一层。它们该被算进的是另一本账——你在几处阵地有可被读到的表述、各处说法是否一致。先把阵地分清,再谈各阵地该做什么,不要把不属于名单的东西塞进名单。

这套东西做到哪一步算完成?

完成线不是一次配置,是一套能持续发现失真的机制。具体三件:三本账各有一句当期结论(缺口在哪一类、抽样可达几条、时间栏记的是什么);归口一张纸写清三个岗位;复查频率定在你跑得动的最低值并且跑过一期、留下快照可比。做到这三件就可以收手,之后每季只花半小时。<b>名单永远不会有"做完"的那一天,它只有"有人看着"和"没人看着"两种状态。</b>

常见问题

什么是站点地图?

站点地图(sitemap)是一份列出站内页面地址及其最后更新时间的名单文件,摆在固定路径上,供搜索引擎与各类爬虫按约定取用。它解决的是"你有哪些页、各页什么时候变过"这两件事,降低机器自己顺链接摸索的发现成本。本篇把它当一件资产而不是一个配置项来讲:名单本身有三本账——条目账(该进的在不在)、地址账(写的和线上是不是同一个)、时间账(那一栏记的是不是真改动),三本账都能在站内自己核对完,不依赖任何平台回话。

站点地图 怎么落地?

按"先自洽、再对外"的六步走,每步留一件实物。一,写期望表——列出你希望被答到的页面,这是所有比值的分母;二,拿当期名单和期望表对缺口,差额按没生成、被过滤、没进产线分三格;三,抽二十条做地址核对,记原样返回、被转走、打不开各几条;四,验更新时间栏的真实度,抽十条比对编辑记录;五,把归口写成一张纸——生成规则谁定、发版后谁验、失真谁修;六,定你跑得动的最低复查频率(多数团队定季度),每期记四个数并存一份名单原文快照。前五步完全不涉及任何平台。

站点地图 为什么重要?

三个理由都不是"它能带来收录"。一,它是入口层里少数能自己完整核对的东西,不用求人、不用等回话,适合人手少的团队先做;二,它是迁移与改版时最容易一次性丢光的单点资产,也是那几件事之后最先能看出问题的仪表;三,做期望表会逼你回答"线上到底有多少个可被单独问到的页面",这个数是内容覆盖、信源建设、提问集分母都要用的底数。同时要认清它不算什么:不决定采信、不改变被怎么说、不是收录的原因。

站点地图 和 DeepSeek 是什么关系?

拆成四格看,别问成一个是非题。头一格,它有没有来取这份名单——没有回显,只能从结果侧倒推;第二格,取到之后拿它干什么——名单是发现线索,不含正文,改变不了你被说成什么样;第三格,与标注层的分工——名单管"有没有这一页",标注管"这一页被归成哪一类",两层的缺各修各的;第四格,答错时名单不担责——那页在线也在单上而答案写错了,重提交一遍不会改变任何字。合起来一句:对这一家,名单是降成本工具,不是信任来源,它的边际价值集中在新站、深层页与批量迁移之后这三处。

名单要放多少条?全站都放吗?

不按条数定,按页面性质定。能被单独拿出来回答一个完整问题的内容页必进;需要登录才能看的、没有独立地址的、页面自己声明以别处为准的,都不进;批量生成的标签页、筛选页、站内搜索页按"这一批里有多少是真人会来的"来卡数量。判断名单好坏的从来不是条目数,是覆盖率——单上的内容页数除以期望被答到的页面数。分母是你自己那张期望表,不是名单。

更新时间那一栏要不要每次全刷成最新?

不要。全刷之后所有条目时间相同,这一栏的信息量归零——机器无法判断该优先回来看哪几页,你和"根本没写这栏"得到的是同一个结果。规则是只有内容实质变化才动时间:改班期、改价格、改地址、改结论算,改样式、换插图、调顺序不算。抽十条里有七条以上对不上真实编辑记录,说明这一栏目前记的是构建时间,要改的是生成规则,不是内容。

提交了多久会有效果?

这个问题预设了一条确定的因果时间线,而名单这一段本来就没有可承诺的时间。它能改变的是机器发现你页面的成本,而发现之后还有读、收、检、引好几段,每一段都由别的东西决定。合理的做法不是等一个周期看结果,而是把名单做到自洽之后就把功夫转到内容与信源那两层。判据一句话:这一轮你改的是名单还是页面,只改了名单的话,这一轮就该结束了。

名单和 robots 冲突了以谁为准?

以许可为准。许可文件把某段路径挡在外面,名单里那些条目就只是白列——机器按约定读到许可是"不许",就不会进。这种冲突不会报错,是名单与许可之间最典型的失效形状:两件事各自看着都"正确",合起来是零。修法也是两头一起改:要么放开许可,要么把被挡的那批条目从名单里去掉,别留着互相矛盾。

没被收录是不是名单的问题?

名单只是候选原因里的一格,而且是最好排的一格。先看这条地址在不在单上、点开能不能读到正文,两个问题当场有答案。在单上且能读到,问题就不在名单,要往下几段查——内容本身是否回答了问题、是否与外部说法一致、是否进了别人的库。"没被收录"至少有四种真实含义,别把它们都算到名单头上,那会掩盖真正要修的那一层。

需要给每一家引擎都提交吗?

不必,也做不到。名单是摆在固定路径上的公开文件,按约定路径来取的程序都能读到,这件事不依赖你在哪家后台填过地址。有提交入口的传统平台值得填一次;生成式问答这一侧多数没有统一入口,也不需要你为每家单独做一份名单——写一份给所有人读是对的,为每家做一份是多余的工。真正需要分开对待的是验证方式,不是文件本身。

改了名单怎么知道有没有用?

分两跳看,别合。头一跳是名单自洽度,改完立刻能测:覆盖率、抽样可达、时间栏真实度,四个数当场对比上一期,这一跳的结果由你自己负责、也看得见。第二跳是那一页被问到时有没有出现、有没有答对,这一跳受内容与外部提及影响,不是名单的功劳也不是名单的过错。把两跳合起来看的人,会既在没用时误改名单,也在有用时误信名单。

平台号、第三方页面要不要进这份名单?

不进。名单只管你自己域名下的页面。平台上的主页、账号内容、第三方登记处的信息各自受平台内部目录与规则支配,那里没有"你的名单"这一层。它们该被算进的是另一本账——你在几处阵地有可被读到的表述、各处说法是否一致。先把阵地分清,再谈各阵地该做什么,不要把不属于名单的东西塞进名单。

这套东西做到哪一步算完成?

完成线不是一次配置,是一套能持续发现失真的机制。具体三件:三本账各有一句当期结论(缺口在哪一类、抽样可达几条、时间栏记的是什么);归口一张纸写清三个岗位;复查频率定在你跑得动的最低值并且跑过一期、留下快照可比。做到这三件就可以收手,之后每季只花半小时。<b>名单永远不会有"做完"的那一天,它只有"有人看着"和"没人看着"两种状态。</b>

相关 GEO 实战文章

免责声明:GEO 属于生成式引擎优化,为行业新兴营销落地方法,各大 AI 大模型算法持续迭代更新,AI 对信源采信规则会动态调整,无法保证网站内容一定会被 AI 引用,不承诺固定流量、线索数量与客户成交效果。墨子教育咨询课程、陪跑服务为知识培训与咨询服务,学习与落地结果取决于学员/企业自身执行能力、行业赛道、内容质量等多重因素。