Robots.txt 生成器
← ToolBox
/ Robots.txt 生成器
🌙
首页
‹
💻 开发
‹
Robots.txt 生成器
📖 查看「Robots.txt 生成器使用指南」
✨ Robots.txt Generator
Robots.txt Generator
📐 工作原理与说明
生成控制爬虫抓取范围的 robots.txt。
语法
:User-agent 指定目标爬虫,Disallow/Allow 控制路径,Crawl-delay 限速,Sitemap 声明站点地图地址。
匹配
:路径采用前缀匹配,支持
*
通配与
$
结束锚定(后者为广泛支持的扩展)。
含义
:
Disallow: /
为全站禁止;值为空则表示全部允许。
局限
:robots.txt 属君子协定,无法阻止恶意爬虫;敏感内容必须做鉴权。
Sitemap(可选)
新增规则组
刷新预览
复制结果
预览
📌 说明
每个规则组可添加多个 User-agent 与路径规则。
支持 `Allow`、`Disallow` 以及自定义 Crawl Delay。
文本直接生成,可用于网站根目录放置。
📚 深度解析:Robots.txt 生成器
💡 常见使用场景
生成爬虫允许/禁止规则。
新站上线前配置抓取规则:屏蔽后台、搜索结果页与接口路径,避免爬虫把无价值页面抓满配额。
生成
`User-agent: * Disallow: /admin` 禁止抓取后台。
❓ 常见问题(FAQ)
robots 能强制保密吗?
不能,仅建议,敏感路径仍需鉴权。
为什么屏蔽了还是被搜到?
因为 robots.txt 只规范「抓取」,不禁止「索引」:若有外部链接指向该页面,搜索引擎仍可能把它收录(显示为「未抓取」的结果)。真正不想被收录应使用 noindex 响应头或 meta 标签;涉及敏感内容则必须做登录鉴权,robots.txt 反而会暴露路径。