做网站收录查询之前,最该准备的不是查询工具,而是能说明“这个网址应该被收录”和“它现在为什么没被收录”的证据。至少需要五类信息:目标网址清单、页面可访问性证据、robots 与 meta 指令状态、站点地图与内链位置、以及查询时间与查询入口。缺了其中任何一类,都容易把“没查到”误判成“被删除”或“被惩罚”。
收录查询的对象必须具体到 URL,而不是只写一个域名。同一个域名下,首页、栏目页、文章页、带参数页的收录状态可能完全不同。准备清单时按下面三类分开记录:
每条记录至少包含完整 URL、页面类型、首次发布时间、最近一次修改时间。如果同一内容有多个网址版本(带 www 与不带 www、http 与 https、带尾斜杠与不带),要一并列出,否则会把重复网址的缺失误认为原页面没被收录。
查询收录前,先确认抓取工具看到的状态码和你浏览器看到的一致。需要记录:
判断规则很直接:如果返回 404 或 5xx,收录查询查不到属于预期结果,应先修可访问性;如果返回 200 但内容为空,问题在渲染或权限,不在收录本身。只有状态码正常、内容可见时,收录缺失才值得进一步归因。
抓取限制和索引移除是两件事。robots.txt 里的 Disallow 只表示不希望抓取,不等于页面一定不会出现在索引里;而 meta robots 的 noindex 才是明确的索引移除信号。准备信息时要分别记录:
<head> 中是否存在 <meta name="robots" content="noindex"> 或类似指令。X-Robots-Tag。如果 noindex 或 X-Robots-Tag 存在,收录查询查不到就是设计结果,不需要再找其他原因。如果只有 robots.txt 限制,页面仍可能被索引,此时应优先看内容质量和内链,而不是断言“被 robots 屏蔽了”。
站点地图能帮助发现网址,但不保证收录。准备这类信息的目的,是判断该 URL 是否被明确告知给搜索引擎,以及它在站内是否孤立。需要整理:
<a href>。如果站点地图里没有、站内也没有入口链接,这条 URL 属于孤立页,收录延迟或缺失是常见结果。此时补内链和站点地图比反复查询更有效。
收录查询的结果会随查询入口、查询语法和时间变化。为了让判断可复核,每次查询都记录:
site: 加域名、还是搜标题片段。不同入口的结论不能互相替代:网页搜索查不到,不代表站长平台里没有索引数据;第三方工具显示未收录,也不代表搜索引擎官方数据一致。把入口和时间写清楚,才能区分“状态变化”和“查询方式不同”。
信息备齐后,按下面顺序执行,可以避免来回猜测:
如果第 1 步就不通过,先修可访问性;如果第 2 步发现 noindex,先确认这是否是有意设置;如果第 3 步命中 Disallow,先判断是否要放开抓取;如果第 4 步没有入口,先补内链和站点地图。只有前四步都正常,才值得把问题归因到内容质量、竞争或索引延迟。
下一步,把上面五类信息整理成一张按 URL 排列的表格,每条 URL 一行,状态码、robots 状态、canonical、站点地图有无、内链数量、查询时间和查询入口各占一列。之后每次网站收录查询都只更新这张表,而不是重新凭印象判断。