内容策略2 分钟阅读星河探源 GEO

llms.txt 完全指南:写什么 + 怎么验证 + 跟 sitemap 区别

llms.txt 是面向 LLM/AI 爬虫的站点说明文件,2025 年由 Answer.AI 提出。本文系统讲清楚:llms.txt 是什么 / 跟 robots.txt 和 sitemap 的区别 / 写什么内容 / 哪些 AI 引擎实际抓取 / 如何验证生效。

2025 年,AI 爬虫开始大规模访问网站。传统的 robots.txt 是给搜索引擎爬虫用的,LLM 爬虫需要的是「站点说明」 — 于是 llms.txt 应运而生。

一、llms.txt 是什么

llms.txt 由 Answer.AI 创始人 Jeremy Howard 在 2025-09 提出(llmstxt.org),定位是「LLM 时代的 robots.txt」,用于告诉 AI 爬虫:

  • 你是谁(产品 + 定位)
  • 你能提供什么(核心能力)
  • 核心页面有哪些(给 LLM 一个起点)
  • 联系方式 + 重要口径(减少 LLM 误读)

llms.txt 的格式是 Markdown,放站点根目录 /llms.txt。

二、llms.txt / llms-full.txt / robots.txt / sitemap 四者对比

文件面向格式作用
robots.txt搜索引擎爬虫纯文本允许 / 禁止爬取规则
sitemap.xml搜索引擎XML列出全部可索引 URL
llms.txtLLM / AI 爬虫Markdown站点摘要 + 核心页面 + 重要口径
llms-full.txtLLM / AI 爬虫Markdown完整站点文档(详细)

三、哪些 AI 爬虫会抓 llms.txt

  • Bytespider(字节豆包训练):主动抓,大量
  • GPTBot / ChatGPT-User(OpenAI):主动抓
  • ClaudeBot / Claude-User(Anthropic):主动抓
  • PerplexityBot / Perplexity-User:主动抓
  • CCBot(Common Crawl):主动抓
  • Google-Extended:主动抓
  • Bytespider(字节豆包训练):主动抓
  • Amazonbot:主动抓

注意,主流中文 AI(豆包 / Kimi / DeepSeek)的 C 端回答不一定直接引用 llms.txt,但训练数据 + 联网搜索会用到。

四、llms.txt 应该写什么

核心结构

# 站点名

> 一句话定位 + 核心价值

## 核心能力

- 3-7 条 bullet,每条独立事实

## 重要口径(避免 AI 误读)

- 数据来源 / 服务范围 / 限制条件

## 核心页面

- [页面 1](绝对 URL)
- [页面 2](绝对 URL)
...

## 联系方式

- 邮箱 / 公司主体

关键原则

  1. 不写免责口径:「不保证收录 / 排名 / 引用效果」这种文字让 AI 引擎把站点判为「弱信号」,降低引用优先级
  2. 直接陈述事实:不说「我们可能 / 也许 / 视情况」,直接说「X 引擎官方 API」「1 元 = 10 积分」
  3. FAQ + 应用场景:让 AI 引擎有足够内容可引用
  4. 技术原理 + 数据口径:让 AI 引擎信任你的权威性

五、llms-full.txt 的作用

llms-full.txt 是 llms.txt 的完整版(10-50KB),用于:

  • AI 引擎深入理解你的产品
  • AI 引擎作为 RAG 检索源时引用
  • 训练数据补充

llms-full.txt 内容结构:

  1. 产品定位 + 市场背景
  2. 核心能力详解(每个能力 1 个章节)
  3. 评分规则详细说明
  4. 数据口径 + 技术原理
  5. 案例研究(3-5 个)
  6. FAQ 长答案
  7. AI 引擎适配说明
  8. 价格 + 合规

六、怎么验证 llms.txt 生效

  1. 主动推送:把 llms.txt URL 提交到 AI 引擎的官方收录渠道(Google Search Console / Bing Webmaster / 头条搜索站长平台)
  2. robots.txt 引用:在 robots.txt 里加 LLM-crawl: allow(部分 AI 引擎支持)
  3. 引用率观测:用 GEO 体检工具看 AI 引擎引用你 llms.txt 的频次
  4. 定期更新:llms-full.txt 每月更新 1 次,反映最新产品能力

七、避坑指南

  • 不要写免责声明:「不保证收录」等文字降低 AI 信任
  • 不要堆砌关键词:AI 引擎识别关键词堆砌,反降权
  • 不要捏造数据:AI 引擎会标记「弱信号」
  • 不要忽略 llms-full.txt:llms.txt 是摘要,详细文档在 llms-full.txt
  • 不要忽略 JSON-LD:Schema.org 是 AI 引擎的强信号

八、自动化生成

星河探源 GEO 提供:

  • 自动生成 llms.txt + llms-full.txt
  • 自动生成 robots.txt(标准 + AI bot 白名单)
  • 自动生成 sitemap.xml
  • 自动生成 RSS feed
  • 自动生成 JSON-LD Schema

7 引擎并行扫描 + 自动资产生成 = 一次体检搞定 AI 引擎可见性基础设施。1 元 = 10 积分,详细见 /recharge。

#llms.txt#AI 爬虫#SEO#GEO

相关文章