数据性质与适用范围
本篇为S1工程模拟方案,按公开技术资料与明确的业务假设编制。容量计算使用文中假设;验收数值是待验证目标,没有本站实机测试日志。实际交付应保存硬件、版本、请求集和原始结果,再确定服务能力。
哪些单据可以自动处理
模拟一家制造企业的采购与质检部门,每天处理6000页订单、送货单、检验报告和供应商附件。约70%是清晰PDF,20%是扫描页,10%含手写、盖章遮挡或倾斜拍照。目标是减少录入工作,把可核对的字段形成ERP草稿,最终确认仍由采购或质检人员完成。
系统提取供应商、物料编码、数量、单位、单价、税率、金额和报告批次;不同单据有不同字段表。企业内部物料编码库作为约束,模型没有匹配到编码时返回候选及原文位置,不能自行创造一个编码。合同条款和质检判定与普通字段抽取分开,避免由一条提示词处理所有业务。
四卡不是一份模型占满
- 推理服务器:4×L40S 48GB、双路CPU、512GB ECC、系统盘镜像、两组NVMe数据盘。
- GPU分工:两卡承载32B文本字段归一化模型,一卡负责OCR与版面,一卡作为视觉疑难页Worker;能否同机运行由驱动、框架和实际峰值显存验证。
- 业务节点:独立数据库与文件存储,25GbE连接;原文、识别结果和ERP写入状态分开保存。
- 主板平台:整机厂商四GPU服务器平台,核对四卡尺寸、PCIe插槽映射、风道及BMC;被动散热卡不装入未经验证的塔式机箱。
GPU分工是初始部署选择。若OCR持续空闲而疑难页排队,应根据监控重分配Worker,而不是为了维持“四卡都利用”强行加载更多模型。主业务库不与模型临时目录共用磁盘配额。
从原件到ERP草稿
上传时生成文件哈希与单据ID,重复提交先查已有记录。OCR输出文字、坐标和置信度;抽取层按单据模板生成结构化字段,每个字段保留页码与框位置。规则层核对数量×单价与分项金额、税额和总额,允许的舍入差异由财务配置。跨页表格先按表头和行号拼接,遇到冲突进入人工复核。
ERP接口只创建草稿,使用单据ID作为幂等键。人工确认时记录操作者、修改前后值和时间。接口超时先查是否已创建,再决定重试,防止同一张送货单产生两次入库。模型不能获得任意SQL或通用ERP管理员权限。
页面处理能力与排班
6000页在10小时窗口内完成,要求平均10页/分钟。按30%余量规划,目标为13页/分钟。若其中600页需要视觉疑难处理,假设每页20秒,则需要200 GPU分钟;若实测每页60秒,就需要600 GPU分钟,恰好占满十小时。两个数均为排程试算,真实耗时需按页面分辨率和模板测量。
试点收集1000页历史脱敏单据,按清晰、扫描、手写比例分层抽样。开发集与验收集按供应商分离,避免同版模板反复出现让准确率虚高。对于金额、物料和批次分别计算字段正确率,不使用所有文字平均准确率掩盖关键字段错误。
通过条件与异常页面
设计目标为清晰模板关键字段正确率至少98%,疑难页全部可复核,1000页中不产生重复ERP草稿。置信度阈值需要由验收集校准;模型给出的高置信度不等于事实正确,金额公式、编码白名单和原页定位必须同时满足。
连续运行8小时,记录各阶段排队长度、P95耗时、内存、显存、文件空间和异常率。模拟上传重复文件、ERP短暂断开、解析进程退出,确认任务状态可恢复。已完成的OCR不重复计算,字段抽取失败可以从原结果重跑;算法版本变化则保留旧结果并生成新版本。
内网更新与上线顺序
离线环境提前准备驱动、容器、模型、Python依赖与许可证清单,安装包经过批准的下载和校验流程进入内网。禁止在服务启动时临时从公网下载字体、OCR权重或分词器,否则断网后的第一次使用就可能失败。
先让一个供应商模板并行运行两周,对比人工录入;再扩至三种单据。模板版本、模型版本和规则版本一起发布,可一键回到上一套配置。方案适合重复性高且有字段校验条件的单据;模糊手写、缺页和重要业务判断保留人工处理通道。
技术依据与复现资料
- PaddleOCR官方仓库:https://github.com/PaddlePaddle/PaddleOCR
本案例由网昱算力学院按公开技术资料和工程约束编制,用于展示方案设计与验收方法,不对应真实客户项目。配置和性能数字必须在目标硬件、软件版本与业务数据上重新验证。
- 编制方式
- 工程模拟
- 客户授权证据
- 未提供
- 原始测试日志
- 未公开


