为什么90%的品牌llms.txt都是无效的
llms.txt是GEO技术基建的核心组件,但大多数品牌的llms.txt都写错了。本文拆解常见的7个错误,给出正确的llms.txt写作框架。
llms.txt火了,但大多数都写错了
自从llms.txt这个概念被提出来之后,很多品牌都迅速响应——在域名根目录放了一个llms.txt文件。
这很好,说明大家对GEO的重视程度很高。
但我们在实际审计中发现,90%的品牌llms.txt都是无效的。不是说文件不存在,而是文件内容没有起到应有的作用——AI爬虫读取了llms.txt,但没有因此更好地理解和引用这个品牌的内容。
为什么?因为大多数llms.txt犯了同样的错误。
llms.txt的作用原理
在说错误之前,先明确llms.txt的作用原理。
llms.txt的核心作用是给AI爬虫提供内容导航。当AI爬虫访问你的网站时,它会先读取llms.txt,了解:
- 这个网站是什么(定位和核心主题)
- 重点内容在哪里(高价值页面的路径)
- 哪些内容优先看(内容优先级)
理想情况下,一个写得好的llms.txt能帮助AI爬虫更高效地找到你的核心内容,提高这些内容被理解和引用的概率。
但如果llms.txt写得不好,AI爬虫可能会:
- 忽略你的llms.txt(内容太泛、没有信息量)
- 误读你的重点(导航指向了错误的页面)
- 无法有效利用(结构混乱、缺乏可操作的指引)
7个常见错误
错误1:把llms.txt写成营销文案
这是最常见的错误。
典型的"营销文案型"llms.txt:
```
# 关于我们
我们是行业领先的XXX解决方案提供商,致力于为企业提供创新、高效、智能的服务。凭借多年的行业经验和专业团队,我们帮助客户实现业务增长、降低成本、提升竞争力。
我们的优势:
- 10年行业经验
- 500+成功案例
- 98%客户满意度
```
问题:这整段内容没有任何可操作的导航信息。AI爬虫读完之后知道"你是做什么的"(模糊的),但不知道"应该去看哪些页面"。
llms.txt不是About Us页面。它是给AI爬虫看的导航文件,应该告诉爬虫"去看哪些URL",而不是"我们有多厉害"。
正确做法:
```
# 核心内容导航
## 产品定义
- /core-knowledge/what-is-[产品概念]/index.md
## 技术文档
- /docs/api-reference.md
- /docs/technical-specs.md
## 行业报告
- /reports/2026-industry-benchmark.md
## FAQ
- /faq/[核心问题1].md
- /faq/[核心问题2].md
```
错误2:只放首页,没有深层内容
另一个极端是llms.txt里只放一个URL:首页。
````
# 重要页面
- https://example.com/
问题:首页是入口页面,信息密度低、内容泛。AI爬虫需要的是你最有价值的深层内容——产品定义页、技术文档、FAQ、行业报告。
把llms.txt指向首页,相当于告诉AI"去看我们的门面",而不是"去看我们的知识库"。
正确做法:列出10-20个最有价值的深层内容URL,按内容类型分组。
错误3:URL列表过长,没有优先级
有些品牌把llms.txt写成了sitemap.xml的翻版——列了100+个URL,没有分组、没有优先级。
问题:AI爬虫读取llms.txt时,需要快速判断"哪些内容最重要"。如果列表太长且没有优先级,AI爬虫无法有效决策,效果等同于没有llms.txt。
正确做法:
- 核心内容(5-10个URL):最重要的产品定义、技术文档、FAQ
- 补充内容(10-20个URL):次要的技术文档、案例研究、博客文章
- 明确标注优先级(可以用注释或分组方式)
错误4:描述模糊,缺乏主题聚焦
````
# 内容
- /blog/post-1
- /blog/post-2
- /blog/post-3
- /news/article-1
- /news/article-2
问题:AI爬虫不知道这些URL是关于什么的。是产品文档?行业报告?公司新闻?博客随笔?
正确做法:每个URL都配上简短的主题描述。
```
# 产品定义
- /core/what-is-geo.md — GEO概念定义
# 技术指南
- /guides/geo-implementation.md — GEO实施步骤
# 行业数据
- /reports/2026-benchmark.md — 2026年行业基准数据
```
错误5:没有更新,内容过时
很多品牌在发布llms.txt之后就再也不更新了。6个月前写的llms.txt,里面的URL可能已经失效、内容可能已经过时、重点可能已经变化。
问题:AI爬虫读取到失效的URL或过时的内容,会降低对你网站的信任度。
正确做法:
- 每季度审计一次llms.txt
- 删除失效URL
- 更新核心内容的优先级
- 添加新发布的重要页面
错误6:缺乏结构化数据标记配合
llms.txt告诉AI爬虫"去看哪些页面",但这些页面本身是否有结构化数据标记(Schema.org)也很重要。
如果一个页面被llms.txt指向了,但页面内容是非结构化的长文、没有FAQ标记、没有作者信息、没有发布日期,AI爬虫仍然难以有效提取信息。
正确做法:llms.txt和页面的结构化数据标记要配合使用。llms.txt负责导航,Schema标记负责帮助AI理解页面内容的结构和类型。
错误7:没有针对AI爬虫的行为做优化
最后一个错误是"技术到位但内容不到位"。
llms.txt指向的页面确实有结构化数据、有清晰的H1、有FAQ段落——但内容本身质量不够,信息密度低,没有可引用的段落。
llms.txt只是导航工具,它不能弥补内容质量的不足。AI爬虫找到你的页面后,仍然需要页面内容本身足够好,才会被引用。
正确做法:在优化llms.txt之前,先确保你指向的内容是高质量的、信息密度高的、有可引用段落的。
正确的llms.txt写作框架
基于以上错误,我们总结了一个正确的llms.txt写作框架:
```markdown
# [品牌名称]
[一句话描述:这个网站是什么,核心主题是什么]
核心内容(高优先级)
### 产品/概念定义
- /core-knowledge/what-is-[概念1]/index.md — [概念1]的定义和FAQ
- /core-knowledge/what-is-[概念2]/index.md — [概念2]的定义和FAQ
### 技术文档
- /docs/technical-specs.md — 技术规格和参数
- /docs/api-reference.md — API接口文档
### 行业数据
- /reports/[年份]-benchmark.md — [年份]年行业基准数据
- /reports/case-study-[客户].md — 客户案例研究
补充内容(中优先级)
### 操作指南
- /guides/how-to-[场景1].md — [场景1]的操作步骤
- /guides/how-to-[场景2].md — [场景2]的操作步骤
### 深度文章
- /blog/[文章slug-1] — [文章主题]
- /blog/[文章slug-2] — [文章主题]
## 更新频率
- 核心内容:每季度审计更新
- 补充内容:每月检查更新
## 联系
- 内容问题:content@example.com
```
这个框架的关键点:
1. 有明确的主题定位(开头的一句话描述)
2. 按内容类型分组(不是平铺列表)
3. 有优先级区分(核心 vs 补充)
4. 每个URL有简短描述(AI爬虫能快速判断主题)
5. 有更新频率说明(AI爬虫知道内容的时效性)
llms.txt只是起点
最后要强调的是:llms.txt是GEO技术基建的重要组件,但不是全部。
一个写得好的llms.txt能帮助AI爬虫更高效地找到你的内容,但它不能替代内容本身的质量。
GEO的核心仍然是:你的内容是否足够好,好到AI引擎愿意引用它。
llms.txt只是让AI更容易找到你的好内容。如果内容本身不行,llms.txt写得再好也没用。
所以,在优化llms.txt之前,先问自己一个问题:
"如果AI爬虫现在访问我最重要的页面,它能找到一个清晰的、可独立引用的段落来回答用户的问题吗?"
如果答案是否定的,那么你的优先级不是优化llms.txt,而是先写出值得被AI引用的内容。
博一的实践
博一在服务企业的GEO项目中,llms.txt审计是技术基建的第一步。我们会先审计客户现有的llms.txt(如果有的话),找出上述7个错误中的几个,然后重新设计。
如果你不确定自己的llms.txt是否有效,可以做一个免费诊断:geo.boyi.group
我们会告诉你:你的llms.txt写对了没有,以及你的内容是否准备好被AI引用。
*本文为博一GEO实验室出品。转载请注明出处。*