检查百度收录的前后环节依赖,核心是沿着“可发现→可抓取→可解析→可索引→可展现”这条链路逐项取证:先用site:查询、百度搜索资源平台里的抓取与索引数据确认现象,再检查上一环是否真的把URL交给了下一环。不要只看一个指标就下结论,因为同一现象往往有多种解释,必须区分“可能原因”和“已经定位的原因”。
要查的是“哪一类URL没被收录”,而不是笼统问“网站有没有收录”。在百度搜索框执行site:你的域名,再配合站内日志或搜索资源平台的抓取频次、抓取异常、索引量数据,把URL分成四组:从未被发现、被发现但未抓取、抓取成功但未索引、已索引但搜索无展现。
百度发现URL主要靠站内链接、外部链接和站点地图。要查的是目标页是否有可爬取的入口,而不是它是否存在于数据库。
<a>链接路径,链接是否被JavaScript延迟渲染或nofollow屏蔽。href;再打开/sitemap.xml确认目标URL是否在列且返回200。抓取限制和索引移除是两件事。robots.txt 的Disallow只表示不允许抓取,不等于可靠的索引移除;被禁止抓取的URL仍可能因外部链接被索引,也可能长期留在索引中。要查的是目标路径是否被规则命中。
robots.txt中是否有匹配目标目录的Disallow,以及页面返回的状态码。User-agent与Disallow路径前缀;用抓取诊断或curl -I查看HTTP状态。200且未被禁止,抓取许可正常;返回403、503或频繁超时,说明服务器在抓取环节拦截;返回404或410,说明URL本身已失效,应检查是否误删或改版未做跳转。抓取成功不等于会建立索引。百度需要从HTML中提取正文、标题和有效链接,再判断页面是否重复、是否有足够价值。要查的是渲染结果和内容质量,而不是只看源码。
site:查同标题或同正文的其他URL,判断是否被判定重复。canonical或合并页面。已索引不等于有排名和点击。要查的是目标关键词下页面是否进入候选、标题与摘要是否被改写、是否有更匹配的页面占据了同一意图。
site:域名 关键词分别搜索,观察命中情况。下一步:选一个具体未收录URL,按上面五环各记录一条证据,再回到最早出现断点的环节修复,而不是同时改动robots、站点地图和正文。