在采集规则编写中安排内容更新顺序,核心判断是:先让搜索引擎发现并理解承载链接与分类结构的列表页,再批量放出详情页,还是反过来。对大多数以栏目聚合为入口的站点,建议先更新列表页、再更新详情页;如果详情页本身是独立流量入口且列表页只是临时聚合,则可以先详情后列表。下面按观察、判断、处理、复查四步说明。
列表页负责暴露链接、分类层级和内容范围,详情页负责承载具体信息。采集规则编写时,如果把详情页一次性全部生成,而列表页仍是空的或没有指向这些详情页的链接,抓取程序就很难顺着路径找到它们。反过来,如果列表页先上线但指向的详情页返回错误或空白,也会浪费抓取配额。
可以先做一项检查:随机抽取10个列表页,确认其中是否包含指向详情页的可抓取链接;再抽取10个详情页,确认返回状态码正常、正文可读、没有被 robots 或 meta 规则挡住。这一步只判断“是否具备被抓取的条件”,不涉及排名。
方案一:先列表页,后详情页。适用于栏目结构清晰、详情页依赖列表页获得入口的站点。判断依据是列表页能否稳定输出链接,以及详情页数量是否较大、需要分批放出。此时列表页先更新,相当于先把路径铺好。
方案二:先详情页,后列表页。适用于详情页已有独立外部入口,或列表页只是按时间滚动的临时聚合。判断依据是详情页能否不依赖站内列表被访问到。如果详情页本身就是用户搜索的直接目标,先让它可访问更合理。
两种方案没有绝对优劣,区别在于入口是否已经存在。采集规则编写时可以用一个简单标准:先让“能带出链接的页面”可访问,再让“被链接的页面”可访问。如果两类页面互相依赖,就按栏目分批,一个栏目内先列表后详情,完成后再进入下一个栏目。
采集规则编写中常见的失误是把发布时间、更新时间全部设成同一时刻,导致列表页和详情页的先后关系无法体现。可以在规则里为列表页和详情页设置不同的时间字段,让更新顺序在页面上可辨认。技术实现上,如果模板中用 <h2> 输出列表项标题,要确保它和详情页标题不重复堆叠。
复查分两层。第一层看可访问性:列表页能否打开、链接是否可点、详情页是否返回正常内容。第二层看抓取与索引状态:通过站点地图或日志观察抓取程序是否访问了列表页,再顺着链接访问详情页。这里要区分抓取、索引和排名三个环节——被抓取不等于被索引,被索引也不等于有排名,更新顺序只影响前两个环节的效率。
如果发现详情页长期没有被访问,先检查它是否在列表页中有链接,而不是直接归因于内容质量。如果列表页被频繁访问但详情页很少,可能是链接层级过深或列表分页规则有问题。复查时记录每批的发布时间和被抓取情况,下一批再调整顺序。
下一步可以选一个栏目做小批量试验:先按“列表页→详情页”的顺序发布一批,观察抓取路径是否顺畅;再选另一个结构不同的栏目按相反顺序发布,对比两者在可访问性和抓取覆盖上的差异,用结果决定后续批次的更新顺序。