要形成一份可复用的 Google 网站收录检查清单,核心不是罗列所有 SEO 知识,而是把“页面为什么没被收录”拆成可验证的证据项:先确认 Google 是否知道这个 URL,再确认它是否允许抓取,最后确认页面是否具备被索引的条件。每查一项都记录命令、时间、原始输出和结论,下次遇到同类问题直接复用同一套流程。
要查的是 URL 有没有进入 Google 的已知范围。可以用 site:你的域名/具体路径 做粗筛,但结果不精确,只能作为线索。更可靠的做法是查服务器日志里有没有 Googlebot 的访问记录,以及 Search Console 的网址检查工具返回的状态。
要查的是 robots.txt、页面 meta 指令和 HTTP 响应是否在阻止 Googlebot。注意,robots.txt 的抓取限制不等于可靠的索引移除:它阻止抓取,但已收录的 URL 仍可能因外部链接出现在结果中。真正想移除索引,应使用 noindex,且该页面必须允许被抓取,否则 Google 读不到 noindex。
<meta name="robots" content="noindex">;返回状态码是 200、301、302 还是 404、5xx。/robots.txt 核对规则;查看页面源代码中的 meta 标签;用 curl 或浏览器开发者工具看响应头。Google 抓取一个页面后,并不保证收录。需要检查内容是否与已有页面高度重复、是否以用户可见文本呈现、是否依赖点击或滚动才出现关键内容、是否有足够的内部链接指向它。站点地图不保证收录,它只是帮助发现 URL 的辅助手段。
site: 加一段独特正文搜索,看是否有其他页面命中;对比同类页面的标题和正文重合度。单个页面不收录,有时原因不在页面本身,而在站点整体。需要检查是否存在大范围 noindex、robots.txt 误屏蔽整站、大量软 404、服务器频繁超时,或 HTTPS 证书错误。HTTPS 不保证安全无漏洞或排名,但证书报错会直接阻断抓取。
每次排查按固定顺序执行并记录:一,URL 是否被 Googlebot 请求过;二,robots.txt 是否允许抓取;三,页面是否含 noindex;四,返回状态码是否正常;五,正文是否唯一且可见;六,站点级配置是否正常。每项写明检查时间、工具、原始输出和判断结论。这样下次遇到“新页面不收录”或“改版后旧页面消失”,可以直接套用同一份清单,而不是重新猜测原因。
下一步:选一个当前未收录的具体 URL,按上述六项逐条记录证据,把命中的第一项作为优先修复点,修复后重新提交并观察日志中 Googlebot 的再次访问情况。