直接回答:当页面从几十个增长到几百上千个,手工逐页改标题、逐条提交、靠人眼比对收录状态、按印象决定内链,这几类工作会最先失效。不是因为手工做得不好,而是样本变大后,个别页面的经验不再代表整体,错误会以同样的方式复制到大量页面。判断标准很简单:这项工作是否需要重复执行、结果是否可以用规则描述、出错后影响面是否成倍放大。三条都满足,就该从手工操作转为规则加脚本或模板处理,人只负责定义规则和抽查结果。
打开你正在维护的页面资料,不管是表格、后台列表还是爬取结果,先做一件事:按模板类型分组,统计每种模板下的页面数量。假设你手上有一份聊城本地服务站的页面表,其中“区域+服务”组合页有四百条,“文章页”有六百条。手工阶段你只看了前二十条,觉得标题都写得不错。规模测试要做的不是继续看,而是把剩下九百多条按同一规则抽样,比如每种模板随机取三十条,检查标题长度、是否重复、是否包含有效区域名。
这一步的结果会直接决定下一步:如果抽样发现重复标题集中在某一种模板,那问题不在页面本身,而在生成这些页面的模板或数据源,你应该去改模板,而不是逐页改标题。如果抽样显示各类模板都有零散问题,说明缺少统一的校验环节,应该先补规则,再谈批量修改。动作和结果的关系在这里很明确——抽样不是为了证明页面好坏,而是为了判断问题出在单页还是出在规则。
页面少的时候,人脑能记住哪些标题用过。页面过百之后,靠记忆判断重复一定会漏。手工改标题的另一个问题是无法验证改动是否引入了新的重复。可执行的做法是:把标题和描述导出成结构化数据,用脚本检查完全重复和高度相似,再按模板规则生成候选,人工只审核候选里语义不通的部分。注意适用条件:如果页面内容本身高度相似,光改标题不会解决根本问题,这时候要回到内容层面决定是合并、删减还是补充差异信息。
手工提交适合新站第一批重要页面,用于确认流程能走通。规模扩大后,逐条提交既无法覆盖全部页面,也无法形成可比较的记录。更合理的做法是先确认站点地图能被正常读取,再用站点地图作为提交和跟踪的主线,把“哪些页面已提交、哪些已被抓取、哪些已进入索引”作为三个独立状态记录。这里要避免一个常见误判:某个页面抓取量下降,不能直接推断是提交方式出了问题,也可能是该页面被其他页面替代、链接减少、内容更新停滞,或者站点整体抓取预算被重新分配。统计变化只是线索,不是结论。
几十个页面时,人能看到全貌。上千个页面时,内链结构会变成一张无法在脑中维护的网。手工加内链的典型失败是:重要页面反复被链,边缘页面几乎无人指向,而维护者只记得自己最近改过的部分。可执行的替代方案是定义链接规则,例如按主题聚类,每个聚类内保证核心页至少被同组三个页面指向,再由脚本检查覆盖率和孤岛页面。规则不需要复杂,但必须能被重复执行和验证。
如果站点按区域拆分页面,一次模板调整往往需要同步到所有区域。手工同步的风险不是慢,而是不一致——改了一部分,漏了一部分,而漏掉的部分可能几个月后才发现。这类工作适合用数据源加模板生成的方式处理,前提是区域信息本身准确。如果区域数据本身有错,批量生成只会把错误放大,所以要先核对数据源,再执行批量动作。
规模扩大不代表所有事都交给脚本。以下三类仍然适合人工介入:第一,核心页面的最终审核,尤其是涉及本地服务范围、联系方式等事实性内容;第二,规则本身的设计和调整,脚本只能执行规则,不能判断规则是否合理;第三,异常页面的个案处理,比如某个页面流量突然变化,需要结合内容、外链、竞争页面综合判断,这类判断依赖上下文,不适合写成通用规则。
区分标准可以这样记:如果一项工作的输出可以用“是/否”“符合/不符合”来描述,并且需要重复执行,就适合自动化;如果输出需要权衡多个因素、且每次情况不同,就保留人工。两者不是替代关系,而是分工关系。
假设你维护一个聊城本地信息站,页面从八十个增加到一千二百个。最初你每周手工检查二十个页面的标题和收录状态,花了三个月发现漏检的页面越来越多。改为规则处理后,流程变成:每周导出全部页面状态,脚本标记标题重复、描述缺失、长期未被抓取的页面,人工只看被标记的部分。假设标记出的异常从每周二十条降到五条,这不代表问题变少了,而是说明大部分问题已经被规则拦截,人工处理的是规则覆盖不到的例外。
这个例子的重点不是数字,而是判断方法:先确认手工检查的覆盖率是否随规模下降,再决定哪些检查项可以写成规则。规则上线后,仍然要定期抽查规则本身是否失效,比如模板改版后旧规则可能不再适用。
回到最初的问题:网站规模扩大后,最先该放弃手工的是那些重复、可规则化、出错影响面大的工作。你手里那份页面清单就是起点——先分组、再抽样、再判断问题出在单页还是规则,然后决定改模板、补规则还是保留人工。这个顺序比直接批量修改更稳妥,也更容易在下一轮规模增长时复用。