你要处理哪类空运文件?
通用 AWB、扫描件、HAWB、MAWB、舱单和混合文件包需要不同数据结构。选择匹配页面,才能保留编号关系、明细、汇总值和异常。
空运文件选择器
你要处理哪类空运文件?
根据手上的文件和目标选择,不需要先理解内部单据层级。把图像质量问题与 AWB 字段问题分开处理
扫描件成功的标准不是 OCR 输出了多少文字,而是关键业务字段能否回到原页核对,并把不确定项明确留给人工处理。
图像与来源
记录页面是否倾斜、裁切、模糊、遮挡或重复。
Source fileSource pageRotationCrop statusImage quality编号与路线
优先复核容易因字符形近而出错的标识符。
AWB No.Carrier prefixOriginDestinationFlight No.件重与费用
把数值与单位拆开,避免小数点和 K/L 单位丢失。
PiecesGross weightUnitChargeable weightCurrencyCharges异常与审核
不确定字段保留为空或标记,不从上下文猜测。
Review statusException reasonReviewer noteReviewed at这类文档的真实难点
不是单纯能不能识别文字,而是能不能直接变成业务可用的 Excel。
复写件、传真件和手机照片常有底纹、折痕、阴影或透印,运单号中的数字最容易识别错误。
AWB 的收发货方、路线和费用区域通常没有完整表格线,单纯 OCR 文本无法恢复字段关系。
多页扫描包可能混入附件、重复页或不同票运单,若不保留文件和页码就很难回查。
FOVATA 怎么处理这类文件
重点不是把页面原样抄下来,而是把你真正需要的字段和结构提取出来。
先判断页面方向、裁切和清晰度,再按 AWB 业务字段提取,不把任意 OCR 文本直接当作最终台账。
将 AWB No.、机场代码、日期、件数、重量和金额标记为高风险字段,导出前逐项复核。
保留源文件、来源页和复核状态,低置信度或遮挡字段进入异常队列,不静默补值。
同一承运人或货代的扫描版式可以复用字段要求,但新的版式和低质量批次仍需抽样检查。
更适合源文件格式不统一、但目标输出需要按业务字段组织的场景。
重点不是还原页面长相,而是减少后续人工整理、对账和录入的时间。
常见输出字段
更适合哪些团队使用
推荐使用流程
从原件上传到结构化 Excel,一般建议按这个顺序测试。
上传扫描 AWB PDF、照片或图片批次,先确认页面方向、边缘和文字是否可辨认。
定义需要的运单字段,并明确编号、机场代码、日期、重量和金额必须人工复核。
导出带来源页和复核状态的 Excel,将遮挡、空白或冲突字段留在异常队列中处理。
常见问题
扫描 AWB 和普通 AWB PDF 转 Excel 有什么区别?
普通文本型 PDF 通常可以直接读取字符;扫描件需要先识别图像中的文字和布局。印章、复写底纹和倾斜会增加错误风险,因此本页更强调来源页、异常标记和人工复核。
手机拍摄的空运提单可以处理吗?
可以测试,但应尽量拍全四角、避免反光和透视变形,并保证运单号、件重和费用区域清晰。无法辨认的字段不应被猜测补齐。
能批量处理不同航空公司的扫描件吗?
可以按统一目标字段整理,但不同承运人、货代和年代的版式差异较大。建议先按版式分组,抽样校准后再处理更大批次。
OCR 结果可以不经检查直接导入 TMS 吗?
不建议。运单号、机场代码、日期、重量和费用会影响后续操作,应根据目标系统规则验证并由业务人员复核后再导入。
印章或手写修改能识别吗?
清晰内容可能被识别,但覆盖文字、潦草手写和低对比复写件的不确定性更高。页面不会承诺所有手写或遮挡字段都能准确提取。
建议先拿这个场景做首轮测试
先选择一批包含清晰扫描、倾斜页、印章和复写底纹的代表性 AWB,验证关键编号和件重字段,再决定是否扩大批量处理。