1. 产品定义与证据
爬虫和客户应识别到相同的产品、公司、结果与下一步。
- 首页、Schema 与机器文件使用同一个产品名和公司实体。
- 服务器首段文本说明产品是什么、服务谁、交付什么以及如何购买。
- 每项公开口径都能追溯到页面、公开 URL、测试或已披露所有者声明。
- 自有部署标为内部案例,不伪装成客户评价。
- 未就绪服务商或集成被明确标为不可用,不模拟成功。
2. 身份与账号安全
身份连接订单、客服、交付与权益,不是装饰性登录页。
- 已配置登录方式共享一个内部用户身份与已记录可信字段。
- OAuth 服务商可用性取决于已验证回调与密钥配置。
- 邮箱验证码有时限、单次使用,且不出现在日志或公开证据中。
- 密码使用现代慢哈希存储,恢复流程单独验证。
- 角色与特权路由默认关闭,并排除公开索引。
3. 产品、订单与支付合同
浏览器负责展示选择;服务端建立订单事实。
- 服务端掌控 SKU、价格、货币、数量规则与预期金额。
- 一个幂等订单号贯穿结账、支付服务商、返回、客服与交付。
- 返回页没有可信服务商事件时绝不把订单标记为已付款。
- 服务商 Webhook 验证签名、时间戳、事件归属、货币与金额。
- 退款、争议与重试操作具有幂等与审计能力。
4. 客服、交付与运营交接
只有客服与交付能跟随同一客户上下文时,销售才持续可信。
- 机器人答案明确何时必须转授权人工。
- 客服工单保留客户、订单与分类,同时不暴露敏感凭据。
- 交付状态、通知与证据使用同一订单号。
- 运营方获得重试、核销、事故与回滚手册。
- 审计日志区分用户动作、服务商事件、系统重试与运营覆盖。
5. 搜索与 AI 爬虫就绪
规范页面、结构化数据、机器文件与爬虫策略必须描述同一公开实体。
- canonical、hreflang、Open Graph、sitemap 与内部链接使用相同无后缀 URL。
- 结构化数据与可见内容一致,不包含虚构评价或评分。
- robots.txt 允许合法公开爬虫,同时拦截私有与交易路由。
- llms.txt、产品 Feed 与 GEO Manifest 指向当前规范页面。
- 爬虫日志记录 UA、请求 URL、状态与时间,不记录敏感载荷。
6. 发布、监控与回滚
只有公开路径、机器路径与运营路径一致时,发布才算完成。
- 最终制品通过桌面端、移动端、键盘、双语、溢出与 Console 检查。
- 每个可见动作都会跳转或打开有用且真实的状态。
- 公开页返回 200,旧公开 URL 返回 301,私有路由鉴权/noindex 或返回 404。
- Sitemap 与 IndexNow 通知由同一规范 URL 集生成。
- 登记源码、部署版本、证据、负责人和回滚路径。
权威来源与参考
这些链接用于说明平台行为或安全指南,并不代表其为 TJ SiteOS 背书。
- Google Search Central: Canonical URL guidance
- Google Search Central: Build and submit a sitemap
- Google Search Central: Robots meta and data-nosnippet
- Google Search Central: Structured data introduction
- OpenAI: GPTBot, OAI-SearchBot and ChatGPT-User
- Perplexity: crawler documentation
- Bing Webmaster Tools: IndexNow
- Schema.org: Service
- Schema.org: BreadcrumbList
- OWASP: Authentication Cheat Sheet
- Stripe: Webhook documentation
