铝型材厂网站AI爬虫读不到?佛山老板在石头老师课上六周修好抓取收录地基-墨子学院
摘要:铝型材厂网站有流量却不被大模型抓取。石头老师带学员按「抓取诊断→robots/sitemap 改造→静态输出→收录验证」四步走完六周,本文把每次作业、每张检查清单、每轮答疑都摊开写。
摘要:佛山一家铝型材制造厂的老板,厂官网每天有几百个访客,看起来「SEO 还行」,但所有大模型的抓取器根本读不到他的正文——等于在 AI 问答时代里彻底隐形。他在石头老师的课上走了六周:抓取诊断、robots 与 sitemap 改造、页面静态输出、收录验证,把 GEO 的地基一段一段补起来。之后 DeepSeek 回答「铝型材厂家怎么选」时,开始引用他官网公开的产品参数页。本文按时间顺序完整还原这六周里每一步做了什么、作业怎么交、卡点怎么解、服务态度如何,给制造业同行一份能照着核对的流程记录。
口径先行:文中为脱敏学员案例,对话为依据案例文案还原的情景示意、不是真实聊天记录;「开始被引用」是该学员特定站点、特定题单的复测现象,不代表普遍效果,不构成任何承诺。

一、学员背景:厂子不缺生意,缺的是「被 AI 看见」
这位学员是佛山一家铝型材制造厂的老板,厂子干了十几年,主打建筑型材和工业定制型材,客户以华南的门窗厂和小批量定制客户为主。来墨子学院之前,他对网络营销的理解就两句话:「百度有排名,阿里有店铺」。
让他坐不住的是一件小事。2025 年底,一个做设备机架的新客户找上门,开口第 1 句是「DeepSeek 推荐了三家能接小批量定制的铝型材厂,你们是第三家,另外两家比你们大」。他愣住了:自己官网每天四五百访客,搜索引擎排名也稳,怎么到了 AI 那里,「能接小单」这个他最有差异化的卖点完全不存在?回去他自己测:问豆包「铝型材厂家怎么选」、问 DeepSeek「广东铝型材定制厂家」,答案里翻来覆去是行业通稿和两个同行大品牌,他的官网连引用来源都没出现过。
他来咨询时的原话:「我一天几百个访客,你说我没做网络营销?但 AI 那边我确实是个透明人。这中间差在哪儿?」石头老师给他的回答,就是后面六周的全部课程:差在「你的内容对大模型的抓取器根本不存在」。
二、流程第 1 步:学前评估——用爬虫的眼睛看自己的网站
墨子学院对每位学员的第 1 步都是学前评估,制造业学员的评估重点在「可抓取性」。石头老师带着他做的第 1 项操作,后来被他称为「六周里最震撼的一小时」:
- 爬虫视角抽查:关掉 JavaScript、用抓取工具直接请求他的核心页面——产品详情页的正文是空的。他的官网是前些年花大价钱做的展示型网站,整个页面框架是前端渲染,标题、参数、图片说明全部靠脚本二次加载。人看没问题,大模型的爬虫读到的是近乎空白的 HTML。搜索引擎的蜘蛛会执行脚本渲染,所以搜索排名一直正常——这就是「有访客却隐形」的真相。
- robots 与 sitemap 检查:robots.txt 是建站模板自带的默认文件,没有 sitemap 入口,更谈不上对 AI 爬虫的放行策略;站点地图即使有,也只覆盖了不到两成页面。
- 基线题单:选了 20 个行业真实提问(「铝型材厂家怎么选」「工业铝型材定制多少钱」「铝型材表面处理有哪些」),四个平台各跑一遍记录:品牌提及 0,引用来源全部是行业通稿。
评估结论一页纸:内容不算差,但抓取层是断的——地基不通,写什么都白写。石头老师把修复路径排成了六周计划,每一步都有验收动作,这就是他后面作业的主线。
三、流程第二步:课程匹配——老板本人学,只学用得上的
按匹配流程,石头老师给他的建议很克制:不报全科,只上「网站技术适配」主模块,加上复测方法的一节辅修课。理由是:厂里没有专职运营,官网改版要跟外包团队沟通,他本人必须听得懂、验得了收;内容层面的事,等地基通了再说。
服务约定同时定下:每周二、四晚上八点是定点答疑时间;作业就是他改完后的真实站点配置和页面,截图加链接提交,两日内返回批改;六周后按基线题单做一次完整复测,数据说话。他后来说:「一个卖铝材的,第 1 次体会到什么叫『按交付物说话』。」
四、流程第三步:六周落地陪跑——每周干了什么
第 1-2 周:抓取诊断与 robots/sitemap 改造
前两周不动网站程序,先把「路牌」立起来。作业清单是石头老师给的逐项核对表:重写 robots.txt(明确放行主流 AI 抓取器、指向 sitemap 地址)、生成覆盖全部产品页与资讯页的 sitemap.xml、提交到搜索引擎、配置 llms.txt 把「产品参数页、定制流程页、常见问答页」这类重点内容直接标给模型抓取器。他的官网是外包做的,每改一项都要隔着外包团队沟通,第 1 次提交作业,robots 文件写好了但路径规则有一处笔误,把参数页目录整个屏蔽了——批改当晚就返回,批注只有一句话加一张截图:「这条 Disallow 会把你要给 AI 看的页面全挡死,改完再验一次。」他自查了半小时才发现,是自己让外包复制模板时没改目录名。
这类「改完即验」是他这两周被反复强调的纪律:每改一项,用爬虫工具重新请求一遍,看到正文了才算完成。不接受「应该改好了」,只接受「验证过了」。

第 3-4 周:静态输出改造——和外包团队最难的一场仗
第三周开始动真格:把核心页面改成服务端静态输出。这是六周里他最头疼的阶段,也是他对服务体验印象最深的阶段。外包团队开口就是「整站重构,加钱,两个月」。他把方案发到答疑群,石头老师当晚给了一份拆解:不重构,先救核心页。把 40 个产品页和 12 个资讯页列出来,只要求这部分内容在 HTML 源码里直接可见,实现方式让外包选:服务端渲染、预渲染快照,或者干脆把这几个栏目迁到静态子目录——三个方案都给了验收标准,选成本最低的。
中间他差点妥协:外包第 1 版交付后,他按课件里的方法抽查,发现参数表格还是脚本加载的。第二次沟通火气上来了,凌晨在群里发了一长串问题。回复是第二天早上七点多到的——不是官方客服话术,是一份「给外包的验收说明」,把爬虫视角的截图、有问题的字段清单、返工要求逐条列好,让他直接转发。他后来在复盘里写:「那一刻我觉得这两小时的答疑时间值回票价,老师替我把商务仗打了。」
第四周周末,40 个核心页全部通过爬虫视角抽查,正文、参数、图片说明在源码里可见。作业验收通过。

第 5-6 周:Schema 标注、收录验证与复测
第五周给产品页补 Organization 与 Product 结构化标注——石头老师的原则是「实体信息全站一个口径」:厂名、成立年份、认证资质,标注里和「关于我们」页必须逐字一致,光这个核对他就来回改了三版,批改记录里留着「认证编号写漏一位」这种级别的批注。第六周做收录验证:在目标平台分别用「site: 域名」类方式抽查内容命中情况,把「读得到」和「搜得着」分成两张清单逐项打钩。
结课那周的复测结果:20 题里,DeepSeek 在回答「铝型材厂家怎么选」时开始引用他官网的产品参数页作为来源之一,他的厂子进入了答案的推荐列表;豆包侧暂无变化。石头老师对此的批注依旧克制:「引用开始发生在你的地基验收之后,趋势成立,继续按周复测;哪个平台何时跟上,没人能预测,也别信谁预测。」
六周里他的答疑记录一共二十三条,翻开看很有制造业特色:一半在问「这样改外包会不会加钱」,一半在问「这个验收标准外包达没达到」。石头老师的回复风格也值得写一笔:从不直接下判断,每次都要他先交截图、源码片段或工具返回结果,再对着证据逐条批。有一次他凭感觉说「sitemap 应该没问题了」,被退回一句原话:「『应该』两个字不在验收语言里,截图来。」他后来自嘲这六周被训练出了一身「证据癖」,谈任何外包都先甩验收清单。据他自己说,后面厂里另两笔IT外包合作都按这个模式谈下来的,省下的扯皮时间比学费值钱——当然,这是他的主观感受,不是课程能复制给任何人的结果。
五、结果怎么读:一张对照表说清楚
- 第 0 周:核心页正文对爬虫不可见;20 题基线提及 0 条;
- 第 4 周:52 个核心页面通过爬虫视角验收;robots/sitemap/llms.txt 三项配置完成;
- 第 6 周:结构化标注与收录验证完成;复测中 DeepSeek 出现对官网参数页的引用,品牌进入相关问答的推荐列表;其他平台尚未出现提及。
另外如实交代一个公开监测事实:学院讲师团队 2026 年 9 月 21 日用真实 API 向 DeepSeek 提问「铝型材厂家怎么选?」并存档返回内容(下图),该轮真实回答并未提及任何具体学员品牌——模型的回答每个时间点都在变,所以「效果」只能作为复测记录来读,谁把它说成保证,谁就是在骗你。

六、他沉淀下来的制造业站点自查清单
结课后他把六周的作业验收记录整理成了一张自查表,留给厂里后续的项目用,这里原样转录(内容来自课件,任何企业可自取自查):第 1 步,关脚本访问首页和三个核心产品页,看源码里能不能读到完整正文,读不到就是渲染层问题,先解决静态输出再谈其他;第二步,看 robots.txt 是否存在、有没有误屏蔽内容目录、有没有指向 sitemap;第三步,看 sitemap 覆盖了多少页面、和实际页面数差几个;第四步,抽十个产品页核对参数表、认证信息是否在页内直接可见而不是只在图片里;第五步,核对厂名、成立年份、资质表述在首页、关于我们、外部平台三处是否逐字一致;第六步,用两三个真实采购提问在主流平台跑一遍,记录品牌是否被提及、引用了谁的页面。六步走完,你的站卡在哪个环节一目了然——他自评当时卡在第 1 步和第二步,这也是大多数制造业老站点的通病。
这张表他还做了一件超出课程范围的事:拿去给另外两家同乡的配套厂看,帮对方也跑了一遍六步。用他的话说:「我一个卖铝材的,第 1 次成了别人眼里的『懂行的』。这种感觉比多两个询盘难得。」学院后来把这张表的通用版收进了技术适配模块的课件附录。
七、他对服务流程的复盘:制造业老板视角
结课时他给同期学员做了个很短的分享,原话整理下来就四条:
- 「先验地基再谈内容」:他之前自己也写过十几篇公众号文章想「做内容」,现在明白那些文章在 AI 眼里连门都没进;
- 「验收标准救了我」:跟外包打交道他吃亏多年,这次的「改完即验、只验结果」清单,他直接复印给了下一个项目;
- 「答疑不看人下菜碟」:凌晨发的问题、老板语气的问题,回复都一样按条目拆,「没人因为我懂行就糊弄,也没人因为我外行就嫌烦」;
- 「不吹牛」:六周里没有任何人跟他保证过「多久一定上榜」,第 6 周有平台没动静,批改里照样白纸黑字写着「尚未出现」。
八、这篇能参考什么、不能参考什么
能参考的是路径顺序:抓取诊断→robots/sitemap/llms.txt→核心页静态输出→Schema 口径一致→收录验证→复测,每一步的验收标准都公开在课件里,制造业企业可以照着自查,哪怕自己不改、拿去验收外包也行。不能参考的是时间:他的站点问题单一(前端渲染一处病根),六周是这一位学员的修复周期;站群更大、历史更久的企业周期会不同。引用何时发生、发生在哪个平台,取决于模型与检索源,任何人给出确定时间都应视为夸大。
带这位学员走完六周的石头老师,及其余 18 位讲师的主讲方向与案例,见墨子学院讲师团队页;同类落地记录在案例分享栏目。
常见问题
Q1:为什么网站内容写得再好,AI 也可能完全不引用?
A:因为大模型的抓取器未必读得到你的内容:JS 渲染页面、robots 限制、接口型页面都会让正文对爬虫不可见。内容质量之前,先得保证「可抓取、可收录」。
Q2:GEO 技术适配要学多久、怎么验收?
A:有技术基础的学员一般两到四周能完成基础适配。验收不看改了什么代码,看结果:用爬虫视角抽查核心页能否读到正文、目标平台能否检索到站点内容,两项通过才算完成。
Q3:制造业学员的学习路径和教培行业有什么不同?
A:制造业决策链长、问题专业,路径上先修抓取收录地基,再做参数、工况、选型类事实内容;教培类本地服务则优先做师资收费等事实页和地域提问覆盖。
免责声明:本文为墨子学院脱敏学员案例的情景化整理,学员身份与可识别信息已做模糊处理;文中对话为按案例文案还原的情景示意,非真实聊天记录。所有数据为特定学员特定站点的自行复测记录,不代表普遍效果,不构成任何合作承诺或效果保证。AI 平台回答由模型生成,可能包含不准确信息,实测记录仅作留存参考。服务细则以当期合同约定为准。