上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引入口没有指向错误地址。对博客来说,重点检查 robots.txt、页面级 robots 指令、canonical、sitemap 和实际返回状态码。只有这五项一致,才具备被正常收录的基础条件。
抓取是搜索引擎发现并下载页面的过程,索引是它判断页面是否值得存入结果库的过程。两者会互相影响,但配置位置不同。博客上线前如果只提交了 sitemap,却没有放开抓取,页面依然进不了索引;反过来,抓取正常但页面写了 noindex,也同样不会出现在搜索结果里。
适用前提是:站点已经有可访问的正式域名,页面内容基本定稿,且你希望这些文章被公开搜索到。如果博客仍处于测试阶段,或者部分内容不打算公开,就应该主动保留屏蔽配置,而不是急着放开。
按下面顺序检查,每一项都能直接看到结果:
你的域名/robots.txt,确认没有 Disallow: / 这类全站屏蔽;同时确认没有误屏蔽文章目录、标签页或静态资源目录。<meta name="robots">,确认没有 noindex。如果使用了 X-Robots-Tag 响应头,也要一并检查。这里要区分“可能原因”和“已经定位的原因”。例如文章未被收录,可能是抓取被屏蔽、页面写了 noindex、内容质量不足或站点整体权重低,不能只看一个现象就断定是某个配置出错。核对的作用是排除确定性问题,而不是保证一定收录。
假设你刚把博客从测试环境迁到正式域名,文章地址是 example.com/post/1。上线前可以这样操作:
example.com/robots.txt,确认没有全站 Disallow,且允许抓取 /post/。example.com/sitemap.xml,确认里面列出的网址都能正常打开,且返回 200。验收信号是:robots.txt 不屏蔽目标目录、文章页无 noindex、canonical 自指向、sitemap 只含正式网址、文章返回 200。五项都满足,说明基础配置没有明显阻碍。至于多久被收录、收录多少,取决于搜索引擎的抓取调度和内容判断,不能靠配置承诺固定时间。
有些博客上线后立刻搜索标题找不到,就以为配置错了。实际上新站或新文章从被发现到进入索引需要时间,短时间内搜不到不等于被屏蔽。此时应优先检查上述五项,而不是反复修改配置。
另一种情况是文章被收录后又消失。可能原因包括内容重复、canonical 指向变化、服务器频繁不可用或页面被改成了 noindex。核对时应以当前实际返回的 HTML 和响应头为准,不要只凭记忆判断。
如果博客包含会员内容、草稿或付费文章,适用条件就不同:这些页面应当保留 noindex 或访问限制,不能为了追求收录而全部放开。抓取与索引配置的目标是让该被看到的页面被看到,而不是让所有页面都进入搜索。
下一步,打开你博客的 robots.txt 和任意一篇文章源代码,对照上面的检查清单逐项确认;发现不一致时,先改配置,再用搜索平台的网址检查工具重新抓取该页面。