二、工作流
将整个词典按五十音顺序切分为41个独立分段,利用subagent并行校对。整体分为五个阶段:
Phase 0 预处理。将OCR后的文本按五十音切分,每条词条编号,为每个分段估算对应的PDF页码范围。
Phase 1 并行校对。每个subagent负责一个分段,执行三语交叉验证。大段如し段3055条单独攻坚,小段如ぬ段14条快速过掉。每批同时跑4到6个subagent。
Phase 2 残项攻坚。对首次运行中被拦截或中断的分段进行重跑,再用Python脚本批量修正剩余的遗漏。
Phase 3 质量验证。等距抽检3000条,覆盖全部41个分段,100%通过。
Phase 4 终版输出。合并分段,生成校对报告。