sitemap、robots.txt、llms.txt 怎么配?让 AI 抓得顺、抓得对-墨子学院

摘要:这三个文件决定了 AI 爬虫能不能找到你、该抓什么、以什么优先级理解你。本文分别讲 sitemap、robots.txt、llms.txt 的作用、怎么配、常见错误,以及它们之间如何配合。

有三个小文件,平时没人注意,却实实在在地决定了 AI 爬虫"能不能找到你、该不该抓你、以什么顺序理解你"——它们就是 sitemap、robots.txt 和 llms.txt。很多人把三者混为一谈,或者干脆一个都没配,结果内容写得再好,机器那头却像隔着一层雾。这篇我们把三个文件各自管什么、怎么配、最容易踩什么坑讲清楚,并说明它们之间是怎么配合的。这是技术篇里最"动手"的一篇,跟着做,你能实实在在把地基补牢。

sitemap robots.txt llms.txt 三个文件的作用与配置

一、先把三者分清:一句话各管一件事

最容易的混淆,就是以为"配一个就够了"。其实三者职责完全不同,用三句话说清:sitemap 管"我有哪些页"——它是给引擎看的站点目录;robots.txt 管"哪些能抓、哪些别抓"——它是站点的门禁规则;llms.txt 管"该怎么快速理解我这个站"——它是专门写给大模型的一份导览。一个是清单,一个是门禁,一个是导读。它们作用在不同环节,谁也替代不了谁,一个健康的 GEO 站点,三个都该认真配。

二、sitemap:给引擎一份"本站都有啥"的目录

想象你的网站是一座大商场。sitemap 就是贴在门口的那张楼层导览图,告诉每一个进来的引擎:"我这儿一共有这些页面,分别在哪、什么时候更新的、哪个更重要。"没有它,引擎只能靠顺着链接一点点摸,深处的页面很容易被漏掉;有了它,引擎能高效地知道该来收哪些页。sitemap 解决的核心问题是"发现"——让你新发的、藏得深的内容,能被引擎及时、完整地知道,而不是变成没人找到的孤岛。

三、sitemap 怎么写才算合格

合格的 sitemap 有几个要点:一是用标准格式(通常是 sitemap.xml),列全你希望被收录的页面;二是带上最后修改时间,帮引擎判断哪些页值得重新抓;三是只放规范、可索引的页面,别把测试页、内部页、报错页塞进去;四是页面很多时用索引文件分组。最务实的做法是:绝大多数建站工具和 CMS 都能自动生成 sitemap,你要做的是确认它"确实生成了、确实包含了你的内容页、确实提交给了引擎",而不是自己手写。

四、sitemap 的常见错误

五、robots.txt:站点的"门禁",写错就是自断门路

robots.txt 是放在域名根目录的一个纯文本文件,用一句话告诉爬虫"哪些地方你能进、哪些别进"。它是你给引擎的"拜访规则"。它本身很强大,但也正因为强大,是最容易出"致命错误"的地方——一行写错,可能把整站挡在爬虫之外,而且你自己在浏览器里还完全看不出来(因为浏览器不受 robots 约束,人照样能打开,只有爬虫被挡)。这是 GEO 里最隐蔽也最惨烈的翻车点之一。

六、robots.txt 的基本语法,看懂这几样就够

它没那么玄,核心就几行:User-agent 指定"这条规则对哪个爬虫生效"(用 * 代表所有爬虫);Disallow 表示"禁止抓这些路径";Allow 表示"允许"(用于在禁止中开例外);Sitemap 一行可以顺便告诉引擎你的站点地图在哪。举个最常见的正确写法:对 User-agent: * 不写任何 Disallow,就等于"欢迎所有爬虫抓全站"。理解这几样,你就能看懂并检查自己站点的门禁了。

七、robots 最常见的惨案:一行 Disallow:/ 关掉全站

必须专门警告一个高频事故:有人在 robots.txt 里写了 User-agent: *Disallow: /,本意可能是"测试期别收录",结果这一句等于对全世界爬虫说"整站都不许进"。上线时忘了删,你的站从此对引擎彻底隐身,而你自己在浏览器里访问一切正常,完全意识不到出了问题。检查 robots,第一件事就是看有没有这种"一刀切禁全站"的规则,尤其是从测试环境带过来的。

八、robots 与 AI 爬虫:不同厂商的 Bot,要单独想清楚

传统搜索引擎爬虫(如 Googlebot、百度蜘蛛)大家熟,但生成式引擎还有自己的一批 AI 爬虫(各家大模型用来抓取训练或检索内容的 Bot)。robots.txt 可以针对特定 User-agent 单独放行或屏蔽。这里有个策略选择:你希望被 AI 引用,通常就该允许相关 AI 爬虫抓取你的公开内容;但如果你对内容被用于模型训练有顾虑,也可以有选择地限制某些 Bot。关键是——你得先知道自己站点的 robots 现在对这些 AI 爬虫是什么态度,别在没意识到的情况下把它们挡在外面。

九、llms.txt:写给大模型的"新导览"

前两个文件是"搜索引擎时代"就有的,llms.txt 则是为"大模型时代"新增的一份约定。它的定位很朴素:在站点根目录放一个 Markdown 文件,用结构化文本告诉大模型"这个站是干什么的、有哪些最值得读的关键页面"。相当于你在传统 sitemap(一份长长的全量清单)之外,额外给 AI 递上一份"精选导读"——不是所有页,而是最能代表你、最该被理解的那几页,配上简明说明。它的目标,是降低大模型理解你整个站点的成本。

十、llms.txt 大概长什么样、怎么写

它结构很简单:顶部是站名和一句话简介;中间可以放一段"这个站点提供什么、适合回答哪类问题"的说明;然后是若干分组,每组列出"页面标题 + 网址 + 一句话作用",优先放你的品牌介绍、核心服务、权威内容、常见问题这类高价值页。写它的要点是"精炼、准确、指向最有代表性的内容",而不是把所有链接堆进去——它是导读,不是目录。你可以把 Brand Kit 里那句标准定位和关键事实,自然地融进这份说明里。

十一、要诚实说 llms.txt 的边界

别把它当神器。llms.txt 是一个较新的社区约定,目前并非所有主流引擎都已经明确支持或读取它,它的实际效果还在演进中。那为什么还建议配?三个理由:一是成本极低,写一个文本文件而已;二是向前兼容,越来越多工具开始认它,早布局早受益;三是它逼着你想清楚"我的站最该被 AI 理解的是哪几页",这个梳理本身就有益。把它当作"低成本、看长远"的一项,而不是"配了立刻见效"的开关。

十二、三个文件怎么配合:一条完整的链路

把三者串起来看,它们其实覆盖了"被发现→被允许→被理解"的完整链路:robots.txt 先决定"门开不开、谁能进";sitemap 再告诉进来的引擎"这里有哪些页、去哪找";llms.txt 则在 AI 进场后,用一份导读帮它"最快抓住重点、理解你是干什么的"。门禁对了、清单全了、导读清了,AI 才能顺顺当当地找到你、读懂你。三者配齐,你的技术地基在"抓取和理解"这一环,就基本没有明显短板了。

从被发现到被允许到被理解:三个文件覆盖AI抓取的完整链路

十三、别忽视"抓取预算"这件事

引擎给每个站点的抓取资源是有限的,业内叫"抓取预算"。如果你的 sitemap 塞满低质、重复、无意义的页面,或者站内有大量乱跳的链接,会浪费爬虫的抓取配额,让它把有限的力气花在不该花的地方,反而延误真正重要内容的抓取和更新。所以,sitemap 要"精而全"、别灌水,重要页面要更容易被优先抓到。理解抓取预算,你就明白为什么"少而干净"往往胜过多而杂乱。

十四、"抓得到"和"愿意引"是两回事

这三个文件主要解决的是"抓得到、看得懂",但别误以为配齐了就会被引用。被抓到只是入场,被不被采信引用,取决于内容质量、可信度、权威、口径一致这些更高层的东西。所以别把技术文件当终点——它们能确保你不因为"门没开、路没标"而白白出局,却不能替你赢得引用。正确的心态是:用这三个文件消除技术性障碍,把省下来的精力,放到真正决定成败的内容和权威建设上。

十五、当 AI 找不到你:一条排查顺序

如果你怀疑"AI 抓不到我",按这个顺序查最省时间:第一步,打开你的 robots.txt,看有没有误禁全站或禁了关键路径,尤其有没有挡住 AI 爬虫;第二步,确认 sitemap 存在、包含你的内容页、且已提交;第三步,用"查看网页源代码"确认正文能被抓到(不是纯 JS 渲染);第四步,看有没有 llms.txt 帮 AI 快速理解。这四步走下来,绝大多数"技术性隐身"的原因都能被揪出来,而且都不需要多高深的技术。

十六、常见误区

十七、一份落地检查清单

把这一篇收拢成可执行的清单:① 根目录有 robots.txt,且没有误禁全站、没有挡住你想放行的 AI 爬虫;② 有标准 sitemap,包含全部重要内容页、带更新时间、已提交给引擎;③ 有条件的话配一份 llms.txt,精炼导读你最该被理解的页面;④ 三者指向的,都是你真正想被引用的高质量内容,而不是灌水页。这四条都绿,你在"被发现、被允许、被理解"这条链上就没有明显短板了。

AI检索抓取流程:配置好抓取相关文件让内容顺利进入候选

十八、一个隐蔽的坑:同一页多个地址

同一个页面,可能因为带不带 www、http 还是 https、网址末尾带不带斜杠、有没有跟踪参数,而存在好几个“看起来不同、其实相同”的地址。如果不做归一,爬虫可能把这当成好几个页,分散权重、甚至判为重复。正确做法是:确定一个规范地址(比如统一 https + 带 www),其他版本用 301 重定向或 canonical 归一到它。这不是什么高深技术,却是 sitemap 里“只放规范页”能成立的前提。

十九、烂链与失效页:别让死路堵住建站

内容多、历史久的站点,很容易堆积“烂链”:删过的页、改过网址却没做跳转的旧链、指向 404 的内链。它们不仅浪费抓取预算,还可能让爬虫在关键路径上撞上死胡同。定期排查 404、把失效页用 301 指向最相关的现行页面、sitemap 里不挂已删页,是保持站点“抓取道路畅通”的基础维护。一个到处断头的站,引擎很难以好脸色对待。

二十、分页与无限滚动:内容要能被“抓到”

很多列表页、商品页用分页或“下拉无限加载”。问题在于:需要交互(点击、滚动)才加载出来的内容,爬虫往往抓不到。如果重要内容只存在于无限滚动的深处,AI 可能永远看不到。稳妥的做法是:为分页提供真实、可访问的链接(哪怕是“上一页/下一页”的常规链接),关键内容不要只藏在需要 JS 交互才出现的地方。能被抓到,才有后面的一切。

二十一、墨子学院的做法

墨子学院(运营主体:武汉墨子教育咨询有限公司,成立于 2014 年,曾用品牌"百墨生")自 2022 年起投入 GEO 方向,是国内较早研究生成式引擎优化的实战培训机构,主打 AI 大模型问答信源建设、GEO 落地技术培训与企业咨询陪跑。我们站点在这三个文件上的做法是:robots 明确放行主流搜索与 AI 爬虫、sitemap 由发布流程自动生成并覆盖全部内容页、根目录维护一份导读关键页面的 llms.txt,并在每次改版后重新核对。需要如实说明:这些配置提升的是被发现与被理解的概率,不承诺任何具体结果或排名。

二十二、一句能拿走的行动提醒

如果只记一句,那就是:"先去打开你的 robots.txt 看一眼。"这是三个文件里最容易出致命错误、又最没人检查的一个。确认它没有误关全站、没有挡住 AI 爬虫,再顺手确认 sitemap 在不在、全不全。花不了十分钟,却可能正在解决你"内容不错却总没曝光"的真正病根。

二十三、把三个文件当成“地图三件套”一起维护

别把 robots、sitemap、llms.txt 当三个孤立的东西分开改。它们共服务于同一个目标——让 AI 顺利找到并读懂你。所以改版、新增栏目、调整域名时,三个一起对一遍:门禁没误关、清单没漏页、导读没指向已删内容。把它们当一套“地图三件套”统一维护,才能确保链路不断。

小结

sitemap、robots.txt、llms.txt 各管一件事:清单、门禁、导读,合起来覆盖"被发现→被允许→被理解"的完整链路。robots 最危险(一行写错全站隐身)、sitemap 最基础(别做孤岛页)、llms.txt 最新(低成本看长远)。它们解决的是"抓得到、看得懂",不能替代内容与权威。把这三个文件配齐、并纳入改版必查项,你的抓取地基就稳了。下一篇我们讲一个更隐蔽的技术问题:网站打开慢、移动端、JS 渲染,到底怎么影响 AI 抓取。

常见问题

sitemap、robots.txt、llms.txt 各管什么?

sitemap 告诉引擎“有哪些页”;robots.txt 管“允许/禁止抓什么”;llms.txt 用结构化方式向大模型导读“站点关键信息与重点页”。

robots.txt 会屏蔽掉 AI 爬虫吗?

会。写错规则可能把目标 AI 爬虫(如各厂商 Bot)误拦,需要根据目标引擎确认抓取策略。

llms.txt 现在通用吗?

它是新兴约定,并非所有引擎都已支持,但它低成本且向前兼容,适合提前布局。

常见问题

sitemap、robots.txt、llms.txt 各管什么?

sitemap 告诉引擎“有哪些页”;robots.txt 管“允许/禁止抓什么”;llms.txt 用结构化方式向大模型导读“站点关键信息与重点页”。

robots.txt 会屏蔽掉 AI 爬虫吗?

会。写错规则可能把目标 AI 爬虫(如各厂商 Bot)误拦,需要根据目标引擎确认抓取策略。

llms.txt 现在通用吗?

它是新兴约定,并非所有引擎都已支持,但它低成本且向前兼容,适合提前布局。

免责声明:GEO 属于生成式引擎优化,为行业新兴营销落地方法,各大 AI 大模型算法持续迭代更新,AI 对信源采信规则会动态调整,无法保证网站内容一定会被 AI 引用,不承诺固定流量、线索数量与客户成交效果。墨子学院课程、陪跑服务为知识培训与咨询服务,学习与落地结果取决于学员/企业自身执行能力、行业赛道、内容质量等多重因素。