1. 定义公开与私有边界
公开产品页、案例、指南、法律页与机器文件应返回稳定规范响应。账号数据、后台控制台、支付确认、上传证据、Webhook 运营与特权报告应要求鉴权或返回不可索引响应。
不要依赖 robots.txt 保护秘密。robots 指令只控制合作爬虫;真正保护数据的是身份认证与授权。
- 把每条路由归类为公开可索引、公开 noindex、需鉴权或不提供。
- 私有与交易路由不进入 sitemap、llms 与公开导航。
- 必要时对公开运营页面返回 X-Robots-Tag 或 meta noindex。
2. 建立一套规范 URL 系统
每个公开概念选择一个 URL。内部链接使用该 URL,旧重复地址永久重定向到它,并在 canonical、hreflang、Open Graph、结构化数据、sitemap 与机器文件中使用同一地址。
- 规范页面直接返回 200,不经过重定向链。
- 旧公开 .html 页面一次永久重定向到无后缀 URL。
- Sitemap 只列规范、可索引且返回 200 的页面。
3. 有意识地允许合法爬虫
Googlebot 与 Bingbot 用于传统搜索。OAI-SearchBot 用于 OpenAI 搜索发现;PerplexityBot 用于 Perplexity 搜索。应遵循当前官方 UA 与 IP 验证指南,不要只信任 UA 字符串。
应结合日志检查 Cloudflare WAF、机器人防护与速率限制。宽泛放行不安全;经过验证的爬虫流量应在合理限速下访问公开页面。
- 用每个目标爬虫策略测试 robots.txt 与代表性公开 URL。
- 记录爬虫 UA、URL、状态与时间,不记录敏感查询载荷。
- 调整 WAF 前先复核 403、429 与挑战响应。
4. 对齐可见页面与机器文件
结构化数据必须反映可见内容。Organization、Brand、Service、Offer、Breadcrumb 与 FAQ 节点使用当前名称、URL、价格与日期,不发布隐藏评价、评分或成果。
llms.txt、产品 Feed、GEO Index、Knowledge Manifest 与 well-known 文件应指向同一规范实体和公开证据页。
- 在 CI 中解析每个 JSON 与 JSON-LD 块。
- 拒绝解析到 404、重复或私有路由的机器文件 URL。
- dateModified 只在内容真实变更时更新。
5. 安全监控发现与发布
使用 Google Search Console 与 Bing Webmaster Tools 监控收录、查询与抓取错误;使用服务器日志监控爬虫状态;把 AI 与自然搜索引荐和 Demo、审计、结账、完成订单事件分开统计。
IndexNow 可在生产部署验证后通知参与搜索引擎。发送真实通知前应审查 dry-run 文件与 URL 集。
- 记录部署版本与规范 URL 清单。
- 执行桌面、移动、双语、链接、Schema 与 HTTP 状态验收。
- 保留回滚版本,不把爬虫提交当作收录成功。
权威来源与参考
这些链接用于说明平台行为或安全指南,并不代表其为 TJ SiteOS 背书。
- Google Search Central: Canonical URL guidance
- Google Search Central: Build and submit a sitemap
- Google Search Central: Robots meta and data-nosnippet
- Google Search Central: Structured data introduction
- OpenAI: GPTBot, OAI-SearchBot and ChatGPT-User
- Perplexity: crawler documentation
- Bing Webmaster Tools: IndexNow
- Schema.org: Service
- Schema.org: BreadcrumbList
- OWASP: Authentication Cheat Sheet
- Stripe: Webhook documentation
