robots.txt与llms.txt:AI爬虫的两把钥匙

文章出处: 上传日期:2026-08-04阅读数量:

想被AI引用,第一步是在robots.txt里把门打开。很多网站会默认屏蔽未知爬虫,结果把AI引擎的爬虫也挡在门外。

主流AI爬虫的User-Agent包括:GPTBot(OpenAI)、OAI-SearchBot、PerplexityBot、ClaudeBot、Google-Extended、Bytespider(字节)、Baiduspider(百度)等。在robots.txt里显式放行它们,几乎零成本,却是GEO的总开关。注意区分:训练用爬虫(如Google-Extended、GPTBot)和检索用爬虫用途不同,放行与否取决于你的业务取舍——工具站靠曝光获客,被引用=被看见,放行划算。


robots.txt与llms.txt:AI爬虫的两把钥匙


2025年之后,一个新的文件格式也开始流行:llms.txt。它相当于给整个网站写一份"说明书",用Markdown格式告诉AI:你是谁、提供什么、核心信息在哪里。ChatGPT、DeepSeek、Kimi、Perplexity等都支持读取llms.txt。如果说Schema是给每个页面贴标签,llms.txt就是给整个网站写目录——两者配合,AI理解你的成本大幅降低。


上一篇:卡内基梅隆大学的那篇论文:GEO为什么能让AI引用率提升40%

下一篇:网站的"AI身份危机":你的品牌在AI眼里是谁?

最新案例