
做SEO的最近应该都频繁刷到llm.txt相关的内容。AI搜索火了之后,大模型爬虫天天来抓站点内容,很多站长心里都有点矛盾:既怕自己熬出来的原创内容被白拿去训练模型,又怕直接屏蔽了,以后AI搜索就没了自己的位置。llm.txt就是用来解决这个问题的,不少人想上手改,却又怕写错规则反而出问题。
先搞懂:llm.txt到底管什么
很多人会把它和robots.txt弄混,其实两者的目标对象完全不同。
robots.txt是给传统搜索引擎爬虫看的,用来管控页面要不要被收录、能不能被抓取;而llm.txt是专门面向大语言模型爬虫的规则文件,用来告诉各大AI厂商的爬虫,哪些内容可以被抓取用于模型训练、哪些可以用于AI搜索引用,哪些是绝对禁止抓取的。
目前主流的AI厂商基本都会遵守这个规则,比如OpenAI、谷歌、字节跳动、百度等,但它还不是强制的行业标准,部分小型爬虫可能不会遵循,这点要先有预期。
llm.txt的基础格式,上手门槛很低
如果你写过robots.txt,那llm.txt几乎可以直接上手,语法逻辑高度一致,核心就三个指令。
User-agent:指定规则对应的爬虫名称,用*代表所有大模型爬虫
Disallow:声明不允许抓取的路径
Allow:声明允许抓取的路径,用来在大范围禁止里放开小范围目录
举个最简单的例子,禁止所有大模型抓取全站内容,写法就是:
User-agent:*
Disallow:/
如果只想禁止某一款大模型抓取后台目录,就写成:
#禁止GPTBot抓取后台目录
User-agent:GPTBot
Disallow:/admin/
路径支持通配符*匹配一类文件或目录,用#添加注释,方便后续维护。
SEO编辑llm.txt的完整步骤
1.先明确核心诉求
动笔写规则之前,先想清楚站点的运营目标。
如果核心诉求是保护原创内容,不想让内容被用于大模型训练,那就可以收紧权限,禁止大部分非搜索类的AI爬虫;如果运营重点包含GEO、AI搜索优化,那就要主动放开对应搜索引擎的大模型爬虫,比如豆包、文心、通义千问的爬虫,保证内容能被AI检索引用。
2.整理爬虫名单与路径规则
先列出来需要管控的爬虫列表,各大AI厂商的开发者文档里都能查到对应的User-Agent名称,常见的比如GPTBot(OpenAI)、Google-Extended(谷歌)、ByteSpider(字节跳动)等。
再梳理站点的目录结构,标记出绝对不能被抓取的路径——比如后台管理目录、会员专属内容、内部测试页面、功能性隐私页面,这些统一设为禁止;公开的资讯、产品介绍、案例内容,根据诉求决定放开还是禁止。
3.编写规则并上传部署
按照语法写好规则后,将文件命名为llm.txt,上传到网站的根目录,也就是和robots.txt同级的位置。上传完成后,直接访问「你的域名/llm.txt」,能正常看到内容就说明部署成功了。
4.验证效果与定期更新
刚部署完先逐条检查路径有没有写错,避免出现该禁的没禁、该放的没放的情况。后续站点目录有调整、或者有新的主流大模型爬虫出现时,及时更新规则就好。
几个容易踩的坑,别中招
第一,别把llm.txt和robots.txt的作用搞混。如果你已经在robots.txt里禁止了某个爬虫,那它连站都爬不进来,llm.txt里的规则对它也就无效了。两者是独立的两套规则,分别管控不同的抓取场景。
第二,别盲目全禁所有大模型。现在AI搜索的用户量增长很快,如果全盘屏蔽,等于直接放弃了AI端的搜索曝光机会,对依赖搜索流量的站点来说损失不小。
第三,别高估它的约束力。它只能约束遵守规则的正规厂商,一些恶意采集的爬虫根本不会理会这个文件,想防恶意采集,还是要靠服务器防火墙、CDN防护这些技术手段。
第四,别写得太杂乱。规则尽量清晰有条理,加上注释,过几个月回头看也能一眼看懂每条规则的作用,方便后续维护。
总的来说,llm.txt不是什么高深的配置,本质就是给AI爬虫看的“抓取须知”。对SEO从业者来说,它会慢慢变成和robots.txt一样的常规配置项,不用过度神化,也不用完全无视。结合自己站点的运营目标,选合适的策略就好。
上一篇:南安网站建设哪家口碑好?
下一篇:宝塔面板破解版可以使用吗?