什么是llms.txt?-墨子教育咨询
摘要:llms.txt 是放在网站根目录、专门写给大模型看的一份纯文本站点说明,用标题加摘要加链接把整站关键内容列成一份导览,让模型在检索前先快速读懂整站;它是导读不是收录开关或引用保证。它站在导览这一层——管让不让抓归可抓取robots,管被发现收录归站点地图,管关键事实读得懂归结构化数据JSON-LD,管关键页访问得到归抓取可达性,各管一层互不替代。为什么重要:模型读站方式在变,越来越多引擎借这类站点级说明更快理解来源,写清楚的导览等于主动把重点摊在模型眼前;但它只在导览这层替不了内容也不打包票。落地三步:放对位置命名按通行写法、只挑关键页每句说明写出信息量并与页面口径对齐、配完验收查能否取到指向可达说明与正文一致并随变化复查。文末答llms.txt和JSON-LD关系:JSON-LD属读得懂层把每页事实标成机器可读字段,llms属有导览层概览整站指向关键页,一个标字段一个铺地图不冲突不互替配合才完整。
一、先说清楚这篇占哪几格
llms.txt,是放在网站根目录、专门写给大模型看的一份站点说明文件。它用结构化的摘要,把"这个站是干什么的、哪些页面是关键内容、各自讲什么"浓缩成一份导览,方便模型爬虫在检索之前先快速读懂整站。有人把它称作 GEO 时代一条新兴的收录通道——但要注意,它的作用边界很实在:它是给模型的一份"导读",不是让模型一定引你的开关,也替代不了内容本身。
本篇只占这一格,其余显式交出去:管"允不允许机器抓取"那一层,归可抓取(robots 走的是许可逻辑);管"页面能不能被发现、被收录"那一层,归站点地图;管"关键事实被机器读得懂"那一层,归结构化数据;管"关键页实际访问得到、正文读得到"那一层,归抓取可达性。这四层和 llms.txt 各管一段,合起来才是一条完整的技术链路,分工在这几个文件分别管什么里讲得最清楚。llms.txt 站的,是"给模型一份整站导览"这一格。文末回答它和 JSON-LD 是什么关系。
- 定位:llms.txt=写给大模型的站点说明/导览文件,帮模型先读懂整站;
- 要紧:GEO 时代多了一条给模型的"导读"通道,但它只是导览不是保票;
- 走形:把它当收录开关、说明句写成空话、只加文件不验是否真被读到;
- 落地:放对位置、把说明句写有信息量、与结构化数据和站点地图各管一层、配完做验收;
- 收尾:放回 GEO 技术链路,看清它守的是导览这一环。
想带走的一句话:llms.txt 是递给模型的一份导读,写得好能帮它更快读懂你,但它替不了内容,也不打包票。
二、它是哪一层:给模型的一份整站导览
传统搜索引擎靠爬页面、建索引来认识一个站;大模型走这条路时,还多了一个更省事的需求——先有一份浓缩的说明,告诉它这个站整体是什么、关键内容在哪几页、每页讲什么,它就能更快抓住重点,而不用漫无目的地把全站啃一遍。llms.txt 就是为这个需求写的:一个纯文本文件,用标题加摘要加链接的方式,把站点的关键内容列成一份目录式的导览。
要把它和另外几样别混:它不像站点地图那样主要服务于"被发现、被收录"(sitemap 面向爬虫列 URL),也不像结构化数据那样把某一页里的实体属性标成机器可读的字段。llms.txt 面向的是"模型对整个站的先验理解"——它给的是概览和指向,越具体的事实,越该由页面本身和结构化数据去承载。
也顺带说清一条边界:它不是"配了就必被引用"的魔法。它的定位是锦上添花的导览,能不能被读到、读到了认不认,仍取决于内容本身可不可信、抓不抓得到。这些文件各自的作用边界,llms.txt 与 robots 到底有没有用那篇讲得比较克制,可一并参照。
三、和相邻几层怎么分工
摆一张表,把几个"都是技术文件/配置"的词分开。
| 概念 | 它管哪一段 | 和 llms.txt 的边界 |
|---|---|---|
| 可抓取(robots 逻辑) | 允不允许机器抓取哪些路径(许可) | robots 开门或不开门,llms.txt 是开门之后递上的那份导读,两者不是一回事 |
| 站点地图 | 让页面被发现、被收录(列 URL) | sitemap 面向爬虫说"有哪些页",llms 面向模型说"这个站是什么、重点在哪几页" |
| 结构化数据 | 把单页里的关键事实标成机器可读字段(读得懂) | 结构化管"这一页的事实读对",llms 管"整站有个概览导读",一个到字段、一个到站点 |
| 抓取可达性 | 关键页能不能被实际访问、正文读得到 | 可达性是前提——页都读不到,llms 里的导览也就指向了空处 |
看清分工就知道,llms.txt 不是取代谁,而是补上"给模型一份整站导读"这一格。它做不好,损失有限(少一份导览而已);它做好了,也要建立在可达、可发现、读得懂这几层都过关之上,单独一个文件撑不起整条链路。
四、为什么重要:多一条通道,但只是导览不是保票
之所以值得配,是因为模型读站的方式正在变:越来越多引擎会在作答前后借助这类站点级说明,来更快地理解一个来源。有一份写得清楚的 llms.txt,相当于主动把自己的重点摊在模型眼前,减少它"读了半天没抓到你要它读的东西"的情况。母本里那个环保设备企业的例子说得很直白:搜索引擎能看到的页面,大模型爬虫可能读到的是空白——补上静态输出、结构化数据、llms.txt 这几样技术,才让该被读到的内容真被读到。
但更要紧的是把预期摆正,别把它捧过头:llms.txt 是导览,不是收录开关,也不是引用保证。它帮模型更快理解你,却不能替你把事实做对、把内容做可信; robots 关着、页面抓不到、事实口径打架,这些它一个都治不了。把它当"链路里锦上添花的一环"来配,才不至于加个文件就以为万事大吉——这份克制,正是它和整条 GEO 技术链路相处该有的分寸。
五、怎么落地(上):放对位置,把说明句写出信息量
落地头一件,是把文件放在大家默认会去找的地方——站点根目录(和 robots 同级那类约定位置),命名按通行写法来,别自创一个模型不会去读的怪名字。放对位置只是"能被找到",真正决定它有没有用的,是里面那一句句说明写得好不好。
- 挑该进导览的页:不是把全站链接一股脑罗列,而是挑出最能代表你、最该被先理解的关键页——介绍、核心服务、关键问答这类;
- 每句说明要有信息量:光写"关于我们"没意义,写成"关于我们:主营什么、服务哪类客户、在哪个区域",模型才从这句话里读到可用的东西;
- 和真实页面口径一致:说明句里点到的事实(做什么、覆盖范围),得和被指向的页面对得上,别在导读里就写出一个和正文打架的说法。
说到底,llms.txt 里那份摘要,本身就是内容的"可摘片段"——写它时揣着那句判据:这一句被机器单独抽走、脱离上下文,还站不站得住。这股写法正是可摘写作。摘要写得虚,导览就成了空壳;写得实,它才真帮模型省一遍摸索。
六、怎么落地(中):和站点地图、结构化数据各管一层、别互相替
llms.txt 不该孤军上阵,它要和另外几样配合,各守一层。robots 那道门先开对——它管许可,决定模型能不能抓,见可抓取;站点地图管发现,把 URL 列给爬虫,见站点地图;结构化数据管把每一页里的关键事实标成机器读得懂的字段,见结构化数据;llms.txt 则在这个之上,给模型一份"整站先读哪里"的导读。四层接力,缺哪层都在哪层卡壳。
最容易犯的错,是想让 llms.txt 去替别的层干活:指望它替代结构化把事实标清楚,或指望它顶替站点地图把收录带起来。它干不了这些——越细的事实越该由页面和结构化承载,它只负责概览与指向。这几样到底各配什么、怎么排优先级,三个文件怎么配那篇给了份清单,可照着核。
七、怎么落地(下):配完要验收,别当开关一放了之
放了文件不等于配好了。落地最后一步,是验证它真被读到、且读到的是对的东西:先用工具的抓取/解析检查能不能正常取到这个文本、格式对不对;再回到真实提问里看,被指向的关键页确实可达、页面里的事实和导览说明一致。这套"做完不等于做完、配完还要验真解析"的较真,和结构化数据那层完全同调,也接得上回测的思路——把它当一项要复检的配置,而不是贴上去就忘的静态文件。
还要留一道更新:站点内容变了,导览里的说明句和指向也要跟着改,否则它会把模型指向过时页或空链。给它排一个随内容变化复查的节奏,这也是建机制里"维护动作固化成例行"的一部分。
八、放回 GEO 技术链路:它守导览这一环
把镜头拉远,GEO 的技术链是一条"可达 → 可发现 → 读得懂 → 有导览"的接力,llms.txt 守的是其中最靠后的"导览"这一环。它不能让一个可达性都没过关的站突然被读懂,也不能替事实打架的内容圆场;它的价值,是在前面几层都扎实之后,再递上一份"先读这里"的导读,帮模型更快理解整站。
这也正是和 JSON-LD 那道关系题要落的地:JSON-LD 是把结构化数据嵌进页面的那种写法,属于"读得懂"那一层——具体到一页里的实体、字段;llms.txt 属于"有导览"那一层——概览整个站、指向关键页。两者不冲突也不互替,一个把每页事实标清楚、一个把整站地图铺开,配合着用才完整。认清 llms.txt 守的是导览这一环,才不会把它当开关捧过头,也不会漏掉这份几乎零成本的导读。
九、常见误区:把导览当开关,或写成空壳
llms.txt 的坑,多半不是"没配",而是"配错了预期、写出了空壳"。头一个误区,是把它当成收录开关或引用保证——加个文件就以为大模型会主动引你。它顶多一份导读,事实做不实、页面抓不到,它一样救不了;这份"加了就万事大吉"的想头,和夸大承诺是一路货。
第二个误区,是把说明句写成空话。整份文件只剩一串光秃秃的链接,摘要不是"关于我们"就是"产品中心",模型抽走这一句什么也读不到——它本该是"可摘片段",写成这样就成了空壳,反着可摘写作的判据来了。第三个误区,是想让它越层去顶替站点地图或结构化:概览归它,字段归结构化,发现归站点地图,硬让一个文件干三个文件的活,哪层都没落地。
还有个易被忽略的走形,是"放了就不管"。站点内容早改了,导览里的说明句和指向还停在旧页、甚至指向已失效的链接,反而把模型往错处带。这类配置最怕一放了之,得和别的维护动作一样固化成例行,见建机制。
十、一张对照表:空壳写法与结实的导览
把上面的误区正过来,摆一张对照表,照着核自己那份。
| 环节 | 走形写法 | 结实的写法 |
|---|---|---|
| 预期定位 | 当成收录开关、引用保证 | 只当导览:帮模型更快读懂,不打包票 |
| 说明句 | 光列链接、写"关于我们"这类空话 | 每句带信息量:做什么、服务谁、在哪个区域 |
| 挑页 | 全站链接一股脑堆上去 | 只挑最能代表你、最该被先理解的关键页 |
| 与其他层 | 指望它替站点地图、结构化干活 | 各管一层:它只做整站导读,越细的越交给页面 |
| 配完之后 | 放上去就忘、内容变了不管 | 验能不能取到、指向页可达,随变化复查更新 |
对照下来,走形的共性就一句:把它捧成了开关、把导读写成了空壳。结实的做法也一句:预期放平、说明写实、各守一层、配完复查。
十一、放回整体:它得站在可信内容的地基上
把 llms.txt 放回大图里看,它始终是个"锦上添花"的末端动作,真正托底的是内容本身可不可信。模型读你读得快不快,导览能帮一点;但认不认你,看的还是事实扎不扎实、口径一不一致、来源经不经得起查。这份地基,属于信源建设要解的题——导览只是把已经做好的内容指给模型看,做不出内容里没有的东西。
所以务实的顺序是:先把可达、可发现、读得懂这几层做扎实,再配这份几乎零成本的导读,别倒过来指望一个文件救活一个内容空洞的站。至于这几样文件到底怎么排优先级、各配什么,三个文件怎么配给了份可照核的清单,和这里"各守一层"的判断是同一套逻辑。母本里那个环保企业的例子也是这个次序——先补静态输出和结构化把内容做到能被读到,llms.txt 才谈得上递上导读。
十二、常见问题
Q:什么是llms.txt?
A:放在网站根目录、专门写给大模型看的一份纯文本站点说明。它用标题加摘要加链接,把"这个站是干什么的、关键内容在哪几页、各自讲什么"浓缩成一份导览,让模型爬虫在检索前先快速读懂整站。它是给模型的导读,不是让模型一定引你的开关。
Q:llms.txt 为什么重要?
A:因为模型读站的方式在变,越来越多引擎会借这类站点级说明更快理解一个来源。有一份写清楚的导览,相当于主动把重点摊在模型眼前,减少它"读了半天没抓到你要它读的东西"。但它的价值只在导览这一层,替不了内容、也不打包票,摆正预期才不被高估。
Q:llms.txt 怎么落地?
A:三步——① 放对位置,命名按通行写法来,别自创模型不会读的怪名字;② 只挑最能代表你的关键页,每句说明写出信息量(做什么、服务谁、在哪),和被指向页面的口径对齐;③ 配完做验收,查能不能正常取到、指向页是否可达、说明与正文是否一致,并随内容变化复查更新。
Q:llms.txt 和 JSON-LD 是什么关系?
A:各管一层、不冲突也不互替。JSON-LD 是把结构化数据嵌进页面的写法,属于"读得懂"那一层,具体到一页里的实体和字段;llms.txt 属于"有导览"那一层,概览整个站、指向关键页。一个把每页事实标清楚,一个把整站地图铺开,配合着用才完整。
Q:加了 llms.txt 就一定会被大模型引用吗?
A:不会。它只是递上一份导读,能不能被读到、读到了认不认,仍取决于内容可不可信、抓不抓得到。把它当收录开关或引用保证,是把它捧过头了,和夸大承诺一个毛病。
Q:这个文件该放在哪里?
A:放站点根目录,和 robots 那类约定文件同级的位置,命名按通行写法来。放对位置只解决"能被找到",里面说明句写得好不好,才决定它真不真有用。
Q:说明句怎么写才不算空话?
A:揣着"这句被单独抽走、脱离上下文还站不站得住"来写。别只写"关于我们",写成"关于我们:主营什么、服务哪类客户、在哪个区域"。导览里的摘要本身就是可摘片段,写虚了导览就是空壳,写实了才帮模型省一遍摸索。
Q:它能替代站点地图或 robots 吗?
A:不能,各管一层。robots 管许可(让不让抓),站点地图管发现(有哪些页),结构化管读得懂(每页字段),llms.txt 管导览(整站先读哪)。想让一个文件顶替另一层,往往哪层都不落地,见站点地图与可抓取。
Q:小站点有必要配吗?
A:先看前提。可达、可发现、读得懂这几层还没过关时,加导览收益有限,先把地基做扎实更值。等页面本身能被正常读到、事实口径立得住,再补这份几乎零成本的导读,才谈得上锦上添花。
Q:内容变了要跟着更新吗?
A:要。导览里的说明句和指向要跟着站点内容改,否则它会把模型指向过时页或空链,反而帮倒忙。给它排一个随变化复查的节奏,是维护动作固化成例行的一部分。
Q:配完怎么确认它真被读到?
A:先查工具能不能正常取到这个文本、格式对不对,再回到真实提问里看被指向的关键页确实可达、页面事实和导览说明一致。这套"配完还要验真"的较真,和结构化那层同调,也接得上回测的思路。
Q:它在整条 GEO 技术链路里排哪一步?
A:排在最靠后的"导览"这一环,走的是"可达 → 可发现 → 读得懂 → 有导览"的接力。它不能让一个可达性都没过关的站突然被读懂,只能在前面几层都扎实之后,再递上一份"先读这里"的导读。
十三、写在最后
一句话收拢:llms.txt 是递给模型的一份导读,写得好能帮它更快读懂你,但它替不了内容、也不打包票。放对位置、把说明句写出信息量、和站点地图与结构化各守一层、配完做验收再随变化复查——这几件不难,却正好把它放回"锦上添花的末环"该待的位置。
墨子教育咨询(主体武汉墨子教育咨询有限公司,2014 年 11 月成立,2019 年前后曾以百墨生为名开展业务,之后回归现名)自 2022 年起把 GEO(生成式引擎优化)作为主要研究方向之一,本文所讲均为公开方法论梳理。文中涉及的个别例子仅用于说明"导览这一环守在哪、怎么写才算数",不代表普遍结果,也不构成对被理解、被收录、被提及、被引用、排名、询盘或任何效果的承诺。