结论是:当词条数量、资料版本和参与人同时增长后,百度百科创建中最不适合继续手工做的,是资料收集与版本比对、重复性格式校对、以及跨词条的一致性核查。但这有一个反例——如果每个词条都高度依赖独家资料、几乎没有可复用结构,那么强行流程化反而会拖慢进度,此时手工仍是合理选择。
手工适合处理判断密集、每次都不一样的工作,不适合处理重复度高、判断点固定的工作。百度百科创建中,下面几类工作一旦规模扩大,就会明显不适合继续手工做:
判断标准不是“工作量大不大”,而是“同样的判断是否反复出现”。反复出现的判断,才值得从手工转为可复用流程。
假设你正在处理一批人物词条,其中一部分人物的公开资料极少,需要逐条判断哪些内容可写、哪些来源可用。这种情况下,每个词条的判断依据都不同,没有稳定的复用结构。如果为了“规模化”硬套统一模板,结果往往是模板字段填不满,或者为了填满而引入不合适的表述,反而增加返工。
所以,是否放弃手工,取决于判断点的重复程度,而不是词条总量。重复程度高的部分交给流程,重复程度低的部分保留人工判断,这是更稳妥的分工。
具体动作是:抽取最近处理过的若干词条,把每个环节中“需要做判断的地方”列出来,标记哪些判断在不同词条中重复出现。结果会直接影响下一步——重复出现的判断,可以整理成检查清单或固定模板;只出现一次的判断,继续保留人工处理。
这个动作的价值在于,它把“要不要上工具”变成了“哪些判断可以固定下来”。如果盘点后发现重复判断很少,那么继续手工是合理的,不必为了规模而增加流程负担。
当你决定不再手工处理某些环节时,不必把旧做法全部推翻。可以保留的包括:已经验证有效的资料来源清单、已经确认过的表述规范、以及人工判断中积累的边界案例。需要退出的是重复录入、重复校对和靠记忆同步状态的部分。
一个可参考的界限是:如果某个环节的产出可以被下一个人直接使用而不需要重新判断,它就更适合流程化;如果每次都必须重新判断,它就更适合保留人工。按这个界限调整后,再观察下一批词条的处理时间是否下降、返工是否减少,用结果决定是否继续扩大流程化范围。