网站规模扩大后,最先不适合继续手工做的,不是写内容本身,而是那些需要跨大量URL重复判断、重复记录、重复核对的工作,例如批量检查索引状态、逐页比对标题模板、手工维护内链清单、逐条跟踪重定向链。判断标准很简单:当同一动作的样本量超过你能稳定复核的范围,手工做法的错误率会先上升,再拖慢后续决策。更稳妥的做法是把这些工作拆成“规则可描述”和“必须人工判断”两类,前者交给脚本或平台功能,后者保留人工复核。
条件一:页面数量在几十到一两百,结构稳定,更新频率低。此时手工做仍然成立,因为你能在较短时间内把关键页面过一遍,而且每次改动的影响范围看得见。比如检查标题是否重复,手工列出主要栏目页和文章页即可,发现重复后直接改,不需要额外维护脚本。
条件二:页面数量达到几千以上,或者由多个栏目、多套模板、多个编辑共同产出。此时手工做不再成立,不是因为手工一定出错,而是因为复核成本会超过处理成本。你改完一批页面后,很难再确认哪些改过、哪些没改、哪些被模板覆盖。这个阶段应优先把批量检查、批量导出、批量比对交给可重复执行的流程。
两种条件的分界不是固定数字,而是“你能否在下一批改动到来前完成复核”。如果上一批还没核对完,下一批已经上线,手工方式就已经不适合继续承担这项工作。
第一类,批量状态检查。包括哪些URL可抓取、哪些被 robots 或 meta 限制、哪些返回异常状态码。手工逐条打开页面只能看到当前结果,无法形成可比较的记录。更合适的动作是用站点地图、日志或抓取工具导出URL清单,再按状态分组。这样做的结果是你能把“异常URL”变成一张可处理的列表,而不是靠记忆回忆哪些页面有问题。
第二类,模板级字段比对。标题、描述、H1、canonical 这类字段往往由模板和编辑内容共同决定。页面少时,手工抽查几个就能发现规律;页面多时,抽查容易漏掉某个栏目或某种内容类型。应把字段批量导出,按模板或目录分组比对。发现某个模板下大量页面字段雷同,下一步就不是逐页改,而是回到模板和内容规则上处理。
第三类,内链与重定向维护。手工加内链在少量页面上可行,但页面规模扩大后,内链会变成一张持续变化的网络。重定向链同理,手工记录容易在多次改版后断掉。适合移交的动作是定期导出站内链接和重定向关系,找出指向404、指向重定向链中间节点、或者孤立的页面。结果会影响下一步:如果问题集中在少数模板,就改模板;如果分散在内容层,就调整编辑规范。
第四类,索引与抓取变化的日常记录。手工每天查一批页面,既难坚持,也难比较。更适合用固定清单定期导出,关注“哪些类型页面长期未被处理”,而不是只看单日数字。需要说明的是,抓取量或索引量下降本身不能单独证明某次改动正确或错误,它还可能来自服务器波动、内容批量下线、站点地图调整等合理解释。因此记录的目的是形成对照,而不是直接下结论。
内容质量判断、页面意图匹配、栏目是否应该合并、某类页面是否值得继续投入,这些仍然需要人工判断。页面规模扩大后,你可以用批量数据缩小范围,但不能把判断本身交给规则。例如,脚本可以告诉你某批页面标题高度相似,但是否应该合并、改写还是删除,取决于这些页面各自服务什么需求。
另一个例外是首次出现的异常。假设某个栏目突然出现大量页面无法抓取,在原因未明前,直接套用批量修复可能掩盖真实问题。此时应先人工确认一小批样本,判断是模板改动、权限配置还是内容迁移导致,再决定是否扩大到全站处理。
这样做的实际结果是:手工工作从“逐页处理”转为“处理规则和例外”,规模扩大后仍然可控。如果移交后发现异常数量没有下降,先检查规则是否覆盖了真实模板,而不是继续增加手工核对。规模扩大后的取舍,不是要不要手工,而是把手工留给必须判断的部分,把重复核对交给可复核的流程。