发票数据提取

先定义字段,再逐项复核发票数据。

字段提取适合需要指定单据字段和明细行的整理工作。先明确字段形状,再把任何输出与对应源文件并排核对。

有用的输出,先有清楚的字段边界。

一张单据页面并不会自动对应一条记录。应先说明哪些字段属于整份单据、哪些属于每一条明细行,以及哪些情况必须由人复核。

指定字段

先列出下游真正需要的字段,不假设整页表格就是最合适的交付形态。

明细行边界

在核对数值前,先确定一条商品行、一个区块还是整份单据应成为一条记录。

源文件复核

当字段会影响财务、运营、归档或合规工作流时,必须把输出与原始文件并排审阅。

公开字段样例

一份公开合成源文件与一份声明性参考工作簿。

字段、代表值和三条明细行都可与同一份源 PDF 对照。该参考工作簿不是 OCR/模型输出,也不是客户数据或对任何真实发票的表现承诺。

单据编号

单据级 · 文本

逐字核对源文件中的打印编号;不要生成、替换或根据其他字段推断编号。

开具日期

单据级 · 日期

以源文件显示的日期为准。没有打印日期时,不能从上下文补猜。

币种

单据级 · 文本

币种来自源文件明确标注,而不是根据金额显示格式推断。

商品描述

明细行 · 文本

确认每条商品文字与明细行的开始、结束边界都仍与源文件一致。

数量

明细行 · 数值

检查单位、整数或小数格式以及是否被拆分到下一行。

行金额(元)

明细行 · 金额

逐行复核金额与小数点;字段值本身不构成税务、会计或付款判断。

复核源文件,而不只是复核字段名称。

字段名称清楚,并不能解决源文件中的空缺、合并行、模糊值或日期与币种歧义。实际使用前应把结果放回原文件逐项确认。

  1. 先定义最小可用字段

    明确你需要的是整份单据字段、每一条明细行字段,还是两者。字段名称不能证明源页中存在对应值。

  2. 确定明细行边界

    本公开样例将三条合成商品行作为三条记录。真实文档可能合并、拆分、重复或缺失信息,因此要以实际源文件为准。

  3. 把输出放回源文件旁复核

    在导出或进入下游流程前,核对编号、日期、币种、商品、数量、单位、金额和缺失值。

这份样例不证明什么。

它不衡量通用字段提取准确率、速度、成本或对扫描件、手写件、拍照件、多语言单据、变形版式、缺失数据或客户文件的表现。

它也不提供税务合规、真伪核验、自动入账、付款、报销审批、会计、留存或隐私结果。公开源文件和参考工作簿都不能代替具体工作流的人工审核。

定义发票字段前的常见问题

什么是发票数据提取?

它是指定所需字段和明细行、再逐项复核的文档整理工作流,不等于把一份单据自动变成可直接使用的税务或会计记录。

这份样例是实际 AI 或 OCR 结果吗?

不是。公开 PDF 和参考工作簿均为 CC0 合成材料;工作簿只是声明性对照数据,既不是保存的模型输出,也不代表其他单据的表现。

能用它验证发票真伪、自动入账或报销吗?

不能。本页和样例不提供真伪核验、税务合规、自动入账、付款、报销审批或会计结果。此类决定需要相应的受控流程和人工审核。

何时应打开真实的字段提取工作流?

当你拥有自己的文档且已定义字段需求时,可进入登录后的工作区。任何结果都应与原始文件逐项复核后再使用。

先定义能由复核人确认的字段。

处理自己的文件前,先确定最小可用字段和明细行边界,再在登录后的工作区中进行实际操作,并将每一项输出与相应源文件复核。

打开 AI 字段提取