优先迁出的不是词条本身,而是你无法从公开渠道重新获得或重建成本最高的部分:自有标注、历史排名与流量观测、词与页面的映射关系、以及带时间戳的抓取结果。纯搜索量、通用难度分这类字段,多数可以换工具重新查;但你在旧工具里积累的判断痕迹,停服后基本无法复原。
把旧工具里能导出的字段列出来,逐个问一句:离开这个工具后,我还能不能拿到同样的值?答案决定迁移顺序。
判断依据是“时间维度”:凡是带日期的观测值,一旦停服就永久缺失;凡是不带日期的当前值,随时可以重查。迁移预算有限时,先保时间序列,再保人工判断,最后才考虑通用指标。
假设你打开旧工具的一个词表页面,里面有 800 个词,部分词带标签和备注。按下面顺序操作,不要一次性全量导出。
每导出一批,立刻做一次校验:行数是否与页面显示一致、日期列是否完整、中文是否乱码。发现某批缺列,先停下补全,再继续下一批。这个动作直接决定下一步:如果人工字段导出失败,就要回到页面手动补记,而不是继续导出可重建的指标。
很多人导出后立刻把列名改成自己习惯的叫法,结果半年后无法判断某个数字来自哪个工具、哪个时间口径。建议保留原始列名,另加一列记录来源和导出日期,例如:
keyword, volume, difficulty, tag, note, source_tool, export_date
这样做的结果是:当新工具的数据与旧底表对不上时,你能快速定位是口径差异还是数据错误,而不是怀疑整批数据。若旧工具字段含义不明,在备注列写清你的理解,不要直接删列。
并非所有停服都值得大动干戈。满足以下条件时,可以只迁人工字段:
反过来,如果词库承担着长期排名监控、竞品对比或跨团队协作,就必须把历史观测和协作字段整体迁出。判断标准是:停服后,是否有人需要回答“这个词三个月前是什么状态”。需要,就迁历史;不需要,就只迁判断。
迁出的数据不要只留一份在本地表格。至少放入一个你能长期控制的存储位置,并保留一份只读副本。完成迁移后做一次抽样验证:随机取 20 行,回到旧工具页面(若仍可访问)核对标签、备注和日期是否一致。抽查不一致时,优先怀疑导出过程的截断或编码问题,而不是原始数据本身。
验证通过后,再决定是否把底表导入新工具。导入前确认新工具的字段能否承接你的标签体系;若不能,先保留底表作为主数据,新工具只作为查询补充。这样即使新工具后续调整,你的核心判断记录仍然在手。