把 PDF、扫描件、图片里的版面结构原样抽出来。不是又一个「PDF 转 Word」——那种工具到处都是; 难的是跨页断开的表格接回一张、标题层级不丢、图片单独抽出来还知道它在原文哪个位置。
中文文档与表格是主攻方向。