标签: robots.txt
-
Cloudflare 于 2026 年 9 月更新 AI 爬虫管理策略,将原本较笼统的 AI Bot 控制细分为 Search、Agent 和 Training 三类。本文记录实际配置过程:保持搜索引擎与 AI Agent 正常访问,将 Training 设置为 Disallow,并启用 Bot Preference Sync,在尽量保留 Google、Bing、ChatGPT、Claude、Perplexity 等搜索与实时发现能力的同时,限制纯模型训练 crawler。文章同时结合 AI Crawl Control 验证实际阻止状态,并记录 Claude-User 受全局策略控制、无法单独放行的现象。
-
A Tour of Go 简体中文站正式上线后,为完善搜索引擎抓取与收录能力,补齐了 robots.txt 与 sitemap.xml,Sitemap 共包含首页和 103 个课程页面,总计 104 个规范 URL。随后完成 Google、Bing、360、百度和搜狗五个平台的站点验证或资源提交,并复用了此前 en.shuijingwanwq.com 的搜索引擎接入经验。过程中还通过 Nginx 精确返回百度、搜狗验证文件,避免修改 Tour 应用本身,同时清理了 Nginx 新版本下旧 HTTP/2 语法及 OCSP Stapling 配置警告。最终五个平台均完成当前阶段接入,也进一步明确了后续开发轻量级搜索引擎提交工具的方向。
-
这篇文章记录了我在 WordPress 中重新安装并启用 Yoast SEO 免费版时遇到的一次旧文章打不开问题。表面上看,问题像是 Yoast SEO 与旧文章存在兼容性冲突;但通过 PHP-FPM 日志排查后发现,真正原因是 WPCode 中一个 PHP Snippet 重复声明了同一个函数,导致 Cannot redeclare custom_desc_and_ads_inserter() 致命错误。最终通过为自定义函数增加 function_exists() 防重复保护,恢复了 Yoast SEO、旧文章页面和底部推荐区块的正常运行。
