llms.txt:全网都在写,97% 无人读
2026年10月2日 · 杂谈
最近给自家官网跑了一次 PageSpeed Insights(PSI),撞见一个新类目:「智能体浏览」。我们的站打了 2/2,而最近被各方安利得最多的 llms.txt,安静地躺在「不适用」一栏里。顺手翻了翻行业数据,看到的对比荒诞得像段子:七个月里,llms.txt 从 0.4% 铺进了十分之一的网站1;而就在今年 5 月,97% 的 llms.txt 文件连一次被访问的记录都没有2。
一场 2026 年互联网最热闹的生成式引擎优化(GEO)狂欢。它是什么、怎么火的、到底谁在读、为什么连 Google 都在自己和自己吵架,这篇一次说清。
速览:
- llms.txt 是放在网站根目录、写给 AI 看的「站点导览」,2024 年 9 月由 fast.ai 联合创始人 Jeremy Howard 提出,2026 年 8 月刚升级到 v2
- 采用率 7 个月涨了 25 倍:普通站点抽样 10.13%,技术圈浓度高的样本里 28%,其中很大一部分是建站平台默认生成的
- Ahrefs 对 13.7 万个域名的日志分析:97% 的 llms.txt 整月零访问;AI 也从不主动去找没发布的文件
- Google 官方指南写明搜索忽略它,几天后 Chrome 团队却给 Lighthouse 加了 llms.txt 检查项
- 该不该写:开发者文档站值得写,营销官网不必跟风
llms.txt 是导览图,不是指令
llms.txt 是一份放在网站根目录的 Markdown 文件,用一段简介加一组分组链接,向 AI 智能体介绍「这个网站是什么、重点内容在哪」——相当于挂在景区门口的导览图,让 AI 不用把整个景区走一遍就知道哪值得看。
它由 Jeremy Howard(fast.ai 与 Answer.AI 联合创始人)在 2024 年 9 月提出,2026 年 8 月更新到 v2,补充了页面 .md 版本、link 关联等细节3。名字故意撞脸 robots.txt,但两者有本质区别:robots.txt 是指令,合规爬虫必须遵守;llms.txt 只是自我介绍,管不了任何爬虫——AI 读不读、信不信,全凭自愿。
写的人确实多:OpenAI、Anthropic、Google 给自己的开发者文档站都配了 llms.txt,Wix 默认给新站自动生成,WordPress 的 Yoast 插件一键开启3。声势浩大,但这些场景有个共同点——全是文档。
七个月 25 倍:火起来靠的是猜测
采用数据是真的在涨。SE Ranking 抽样 30 万个域名:2025 年 4 月只有 0.4% 的网站挂了 llms.txt,7 个月后涨到 10.13%,翻了 25 倍1;在技术浓度更高的 Ahrefs 自家样本里,这个数字是 28%2。GEO(Generative Engine Optimization)服务商把它做成了标配产品,建站平台把它做成了默认开关。
但推着大家写的不是证据,是猜测。Ahrefs 给这场采用潮下的判语是:驱动力是「AI 平台可能会开始读它」的投机,而不是任何平台确认了在读2。平台还没官宣,渠道先把货铺满——更像是渠道在自我加热。
97% 的文件,整月无人问津
Ahrefs 用自家网站分析产品的服务器日志做了目前规模最大的检验:13.7 万个域名,完整观察 2026 年 5 月2:
- 挂了 llms.txt 的域名占 28%,其中 97% 的文件整月零访问——没有 AI 爬虫,没有真人,什么都没有
- AI 从不主动寻找 llms.txt:对不存在的文件的请求里,AI 请求是零,探测 404 的几乎全是人类(多半是 SEO 从业者在查同行)
- 有访问记录的那 3% 里,大头也不是 AI:SEO 审计工具占 21.7%,「研究 llms.txt 的行业工具」(GEO 打分器、校验器、目录站)合计 12%——一个行业在勤奋地审计一个没人读的文件
- AI 相关请求合计 19.5%,其中训练爬虫远多于检索爬虫:抓得最多的是 GPTBot(喂模型训练),第二名是 Claude Code(编程智能体);而理论上最该用它的 AI 搜索机器人(OAI-SearchBot、PerplexityBot 们)合计只占 1.1%——连聊天软件的链接预览机器人 Slackbot,抓得都比 PerplexityBot 多
顺带一提,给 llms.txt 加了检查项的 Lighthouse,在这份日志里贡献了约千分之一的访问量:22 次。体检工具自己也在读,就是这个力度。
SE Ranking 还做了归因检验:把 llms.txt 变量从机器学习模型里删掉,预测「哪些站会被 AI 引用」的准确度反而略升——就引用效果而言,它目前与零无异1。
Google 在和自己吵架
最戏剧性的一幕发生在 2026 年 5 月下旬的一周之内。
Google 搜索团队先更新了「生成式 AI 功能优化指南」,在「辟谣」一节里写明:不需要为 AI 搜索专门创建机器可读文件,Google Search 完全忽略 llms.txt,有它不会加分,没它也不会扣分4。几天后,Chrome 团队给 Lighthouse 上线了「智能体浏览」实验类目,llms.txt 赫然在列,理由是「没有它,智能体可能要花更多时间爬你的站」5。
Lily Ray 拿这个矛盾去追问 Google 的 John Mueller,他的解释是:llms.txt「不是为搜索做的」,它是给 AI 编程工具解析开发者文档时省 token 的「临时拐杖」——非文档类网站用不着惦记2。
这解释得通,也解释了我们 PSI 里的现象:那个类目不计入任何总分,llms.txt 在我们站上直接被标了「不适用」。搜索团队没说谎,Chrome 团队也没说谎,只是前者关心排名,后者关心智能体的抓取效率——两套 KPI,一个文件。
该不该写:比 llms.txt 值钱的事
那到底写不写?分两种情况:
- 开发者文档站(API 手册、SDK 指南这类):值得写。 你的读者里如果有 Claude Code 这类编程智能体,llms.txt 是它们真会顺着爬的目录——规范作者说的「用得最重的场景」就是这里3。
- 营销官网:不必跟风。 97% 的零访问基线摆在那,指望它带来 AI 引用,相当于指望一封没人拆的信带来生意。
真正决定 AI 会不会引用你的,还是那三件朴素的事:爬得进来(robots.txt 别误封 AI 爬虫)、读得明白(语义化 HTML、干净的无障碍树——WebAIM 2026 年报告显示平均每个网页有 56.1 个无障碍错误,还在涨6)、值得被引(内容有具体数字、具体观点,段落能独立成句被摘走)。这三件事做好,llms.txt 只是锦上添花的一小项;没做好,写一封没人拆的信也救不了。
什么时候值得写?等哪天有 AI 平台官宣「我们的爬虫会读 llms.txt」,这个文件会一夜之间变成标配;在那之前,它是清单上可有可无的一项。