SEO

LLMs.txt 与数字营销:2026 年从业者的诚实看法(含我部署在这博客上的那份文件)

LLMs.txt 与数字营销:2026 年从业者的诚实看法(含我部署在这博客上的那份文件)
目录

两周前,我在 aimarketingfocus.com 上加了一个 /llms.txt,然后就坐在那等着看会不会发生点什么。

老实说:什么都没发生。AI 引用没有上升,Perplexity 和 ChatGPT 的推荐流量没有变化,我也找不到任何能归因到那个文件的访问波动。这其实是我现在能告诉你的、关于 LLMs.txt 最有价值的一句话——因为目前市面上的内容,要么是厂商的带货稿,要么是反对者的口水战,两边都没对上现实。

LLMs.txt 是一份真实存在的、定义清晰的规范文件。但截至 2026 年中,没有任何一家主流 AI 引擎公开承认会读取它。这两件事同时成立,做营销的人得同时把这两件事算进去。

LLMs.txt 到底是什么

这个规范由 Answer.AI 联合创始人 Jeremy Howard 在 2024 年 9 月 3 日提出。它是一份放在 /llms.txt 路径下的纯 Markdown 文件,功能是给大模型一份由你精心挑选、附带简介的内容清单——对应到 robots.txt 给爬虫的访问规则、sitemap.xml 给爬虫的 URL 清单,LLMs.txt 给 LLM 的就是「你该看什么、为什么值得看」。

结构非常简洁:H1 是站点名称,blockquote 是一句话摘要,接下来用 H2 分组,每组里是若干带一句话简介的链接。还有一个可选的 ## Optional 小节,告诉 LLM 在上下文窗口吃紧时可以丢掉这些链接。同目录的姐妹文件 /llms-full.txt 可以装下所有链接页面的完整 Markdown——但大多数站点不会发布,原因下面会说。

Cloudflare 的 developers.cloudflare.com/llms.txt 是真实在跑的,而且他们给将近 100 个子产品各自挂了一份子级 llms.txt。Firecrawl 的文档也有一份。Anthropic 的官网没有。这就是当前的采用图景:几家靠谱的技术型发布方、一堆厂商话术、零家引擎背书。

这个文件为什么会出现

Howard 当初提这个规范时的理由,即使你最后决定不部署,也值得认真听一下:LLM 读网站的方式,和人、甚至是传统爬虫都不一样。传统爬虫看的是完整 HTML、JS 渲染后的 DOM、导航、广告、Cookie 横幅。LLM 在做检索+引用时,拿到的大多是一团噪音——上下文窗口被页面 chrome 吃掉一大半,真正能用的内容反而被稀释了。

llms.txt 就是 LLM 版的「跳过废话,直奔重点」。你作为发布方,自己决定什么算「重点」,自己用你的语气写简介。这就是它唯一干的事。它不管爬虫准入,不喂结构化数据,也不能替代 schema.org。

老实交代现状

这部分是大多数文章一笔带过的:

  • 没有一家主流 AI 引擎确认会读取 /llms.txt OpenAI(GPTBot、OAI-SearchBot)、Anthropic(ClaudeBot)、Google(Google-Extended)、Perplexity(PerplexityBot)都没有公开说过会消费这个文件。最多,它是一个礼貌信号,留给未来某天愿意读取它的引擎。
  • 没有同行评审的案例研究证明引用量提升。 各路 GEO 营销文章里报的数字很大,但没有任何一个能把 LLMs.txt 单独拎出来当因变量。你要是看到一个数字套在「LLMs.txt 让我的引用量涨了 X%」上面,默认是厂商文案。
  • 最强的真实采用方是 Cloudflare——而 Cloudflare 的 CEO 同时也是这套规范最积极的鼓吹者。这是线索,不是证明。
  • llms-full.txt 是个伪装成技术决策的内容授权决策。 把你每篇 Markdown 完整放出去,等于给任何爬虫一份干干净净的训练语料。有人这么干,但多数站点不该这么干。

那为什么还要部署?

为什么我还是建议部署

三个理由,但没有一个是「AI 搜索会因此奖励你」:

1. 成本极低。 静态站用一个下午就能从内容集合生成一份。我给这个博客加了一个构建步骤:扫一遍 src/content/posts/,把最近 30 篇连同摘要写到 /public/llms.txt。总共花了 40 行脚本加一次 CI 重跑。

2. 防御性强。 即使今天没有任何引擎读它,这个文件也是一份由你亲自策展、亲自描述的「我希望你看到的版本」。未来某天有 AI 系统来抓你的站,这个文件已经在那儿说:「这是我的官方摘要,这些是官方 URL。」这永远比让模型从你页脚里猜要好。

3. 它逼你做一次策展决策。 写 H1、写 blockquote 摘要、给每个链接写一句话简介——这件事本身就是一次有价值的练习,和你做内链审计、规划内容支柱页时干的活是同一类:选出值得被看见的内容。大部分站点从来没做过这个练习,应该做。

一份你可以直接抄的文件

下面是这个博客实际的 llms.txt(稍作精简):

# AI Marketing Focus
> 来自 15 年实战经验的 AI + 数字营销打法。
> 每周更新中英双语新文章。

## 最新文章
- [LLMs.txt 与数字营销](https://aimarketingfocus.com/posts/llms-txt-digital-marketing/): 2026 年从业者对 LLMs.txt 规范的实战看法
- [从 SEO 到 GEO](https://aimarketingfocus.com/posts/geo-aeo-from-seo-perspective/): 生成式引擎优化的实操指南
- [AI 搜索正在吃掉你的 SEO 流量](https://aimarketingfocus.com/posts/ai-search-traffic-shift/): 当 AI 概览抢走你的点击,真正有效的是什么

## 核心分类
- [SEO](https://aimarketingfocus.com/category/seo/): 搜索、AEO、内容审计
- [付费媒体](https://aimarketingfocus.com/category/paid-media/): Meta、Google、PMax、 RSA
- [AI 工具](https://aimarketingfocus.com/category/ai-tools/): 与 Claude、ChatGPT、Gemini 的工作流
- [营销](https://aimarketingfocus.com/category/marketing/): 漏斗、邮件、增长、留存

## Optional
- [文章归档](https://aimarketingfocus.com/archive/): 全部 170+ 篇文章,按日期索引

有两个值得指出的设计选择:## Optional 里放归档,因为上下文吃紧的 LLM 不需要每一篇——只要那些被策展好的头部门户路径就行。每一个链接的简介都是白话散文,不是关键词堆砌。这就是规范要求的真实格式。

它在营销栈里排在哪

LLMs.txt 位于内容之上、抓取控制之下。在 2026 年的营销栈里,它的优先级是:

  1. 真正有用的内容——AI 引用的是「有用的」,不是「可发现的」。
  2. 结构化数据(schema.org/JSON-LD)——喂的是检索系统真正会吃的实体级信号。
  3. GEO/AEO 实践——清晰的论断、可引用的数据、有署名的作者信息、真实的一手经验。(参考我的 GEO 指南)
  4. robots.txt 里的 AI 爬虫控制——按你的内容授权策略,放行或拦截 GPTBot、ClaudeBot 等。
  5. llms.txt——给愿意读它的那部分系统,一份关于你最佳内容的礼貌说明。

注意它落在哪:有用、便宜、防御性强,但不是承重墙。如果你在清单其他项都不做的情况下发了一份 llms.txt,你只是写了一份好看的 Markdown。如果其他四项都做了、唯独没做 llms.txt,你的 AI 搜索表现基本没差别。

我现在会怎么建议

按站点类型分档:

  • 企业级内容站或文档站: 今天就发 llms.txtllms-full.txt 只针对那些你希望被广泛收录的内容。每个季度回顾一次。
  • 电商或 SaaS 营销站: 发一份精简版 llms.txt,只放最重要的 20 个产品/类目页。不发 llms-full.txt
  • 小企业或个人博客: 暂时跳过。把精力放在上面四项上。等哪天有引擎确认会读这个文件,再回来。
  • 任何有付费墙或内容授权敏感的站点: 不要llms-full.txt。便利性不值得冒语料泄露的风险。

我目前看到的最大一个错误,是把 LLMs.txt 当成排名因素,然后把真正驱动 AI 引用的内容工作和结构化数据往后放。这个文件是点睛之笔,不是地基。

如果你给自己的站做了一份 llms.txt、部署了,然后盯着看了 60 天——你大概率会和我看到的一样:没有任何可衡量的变化。这不是删掉这个文件的理由。这是让你把预期放回现实、把 GEO 预算集中到真正能撬动数字的那几层上去的理由。