识别配置互相冲突,核心是判断同一份抓取或收录指令在不同位置是否给出了不同结论。对搜狗网站收录来说,最典型的冲突是:robots.txt 允许抓取,但页面 meta robots 写 noindex;或者 sitemap 提交了某网址,但 robots.txt 又屏蔽了该目录。判断方法不是看某一处配置写得对不对,而是把影响同一网址的所有配置列出来,逐条对比是否指向同一个结果。
从交付结果倒推:要让一个网址被搜狗收录,需要它可被抓取、可被索引、可被发现。对应检查以下位置:
<meta name="robots">:是否含 noindex、nofollow;X-Robots-Tag:是否含 noindex;把这些信息按 URL 逐条记录,冲突就会显形。例如 robots.txt 写 Allow: /,但页面 meta robots 写 noindex,这就是明确的指令冲突:前者说可以抓,后者说不要索引。
配置冲突往往发生在两层之间,不能混在一起看。
抓取层冲突:robots.txt 屏蔽了目录,但 sitemap 又提交了该目录下的网址。结果是搜狗抓取受限,sitemap 里的网址无法被正常获取。robots.txt 的抓取限制不等于可靠的索引移除,它只是阻止抓取,不保证已收录网址会消失。
索引层冲突:页面可以被抓取,但 meta robots 或 X-Robots-Tag 写了 noindex,同时 canonical 又指向自己。这时抓取正常,但索引被主动拒绝。若 canonical 指向的是另一个页面,则该页面的收录信号会集中到目标网址,原网址可能不单独收录。
判断顺序建议是:先确认抓取层是否放行,再确认索引层是否允许,最后确认发现路径是否有效。任何一层被阻断,收录都不会按预期发生。
对每个待收录网址,按以下检查项逐条打勾或打叉:
如果第 1 项为“允许”,第 2 项为“noindex”,冲突成立,优先处理 noindex。如果第 1 项为“屏蔽”,第 5 项为“已提交”,冲突成立,优先处理 robots.txt 或从 sitemap 中移除该网址。判断结果只有两种:配置一致,或存在至少一处矛盾指令。
修复不是改完就结束。需要明确责任:谁负责改 robots.txt,谁负责改页面模板,谁负责重新提交 sitemap。验收标准是同一网址在所有配置位置上给出相同结论。
验证时注意:站点地图不保证收录,HTTPS 不保证安全无漏洞或排名。修改后搜狗重新抓取和更新索引需要时间,不能以“改完立刻收录”作为验收条件。可执行的下一步是:先选一个目标网址,按上面的检查表逐项核对,把冲突项记录在同一个表格里,再按抓取层、索引层、发现路径的顺序逐项修复。修复完成后,用搜狗的抓取诊断或提交入口重新提交该网址,观察后续抓取记录是否与配置一致。