数据性质

本方案为S1工程模拟,不对应真实客户项目;容量数字是带假设的计算,性能值是验收目标,未提供本站实机日志。

场景与业务目标

模拟一所地方档案馆已有30万页扫描资料,包含清晰打印件、倾斜复印件与少量手写内容。工作人员30人,设计峰值6个检索请求、2个生成请求,每天新增1000页。目标不是让模型“替代档案员”,而是缩短定位原页的时间,回答必须链接到可复核的扫描件。涉密与限制开放资料不进入本方案的公共索引。

本方案所有规模是设计假设,未对应真实机构与实机日志。手写与严重模糊页进入人工队列,不承诺通用视觉模型能够完整准确识别。服务结果用于检索辅助,不作为历史事实的唯一凭据。

双卡节点分工与平台条件

试验配置为2张48GB级GPU、512GB ECC内存,独立模型NVMe和容量型扫描件存储。CPU、主板、插槽与显卡风道采用整机厂商验证组合;48GB是容量档位,不意味着任意显卡、机箱都等价。GPU A承载OCR或视觉识别批任务,GPU B承载量化问答模型,向量检索由CPU和数据库完成。

模型候选为中文OCR引擎、BGE-M3稠密向量与经过验证的32B量化问答模型。严重复杂页可转视觉模型,但不把所有30万页都交给大VLM。分开资源池是为了让历史导入不阻塞白天检索,最终容量须压测。

从原件到可追溯段落

每页保存文件哈希、来源编号、卷号、页号、访问级别、OCR版本与识别结果。原图不被清洗程序覆盖。段落切分保留跨页关系,表格独立保存行列信息,页眉页脚不作为主体重复入索引。

处理任务先检查文件损坏和旋转,再识别、做质量抽样、分块并编码。低置信和术语异常进入复核;修改后的文字保留原版本与操作记录。用户问答先按权限过滤候选,再重排与生成,不能检索后仅在界面隐藏无权限页。

导入周期与存储账本

若试验测得平均每页处理2秒,30万页纯处理约60万秒,即166.7小时。每天安排8小时,理论约20.8个工作日,还未包含失败重试、人工复核和停机。这里2秒是试算变量,不是设备性能;实际测量后替换这个值。

平均扫描件1MB,则原件约300GB;若每页4个块,约120万块。1024维float32稠密向量的原始值约4.9GB十进制,数据库行、文本和近似索引另计,不能用4.9GB作为总存储报价。再为OCR中间文件、模型、备份及升级副本预留空间。

验收数据怎样准备

建立500页分层样本,含清晰、倾斜、表格、模糊和手写,各保留人工真值。OCR按字符错误率和关键字段准确率评估;不把手写失败平均进清晰打印件后掩盖差异。随机抽取20%的样本由第二人复核,避免标注本身成为误差来源。

问答准备150个问题,其中30个在资料中没有答案、30个需要跨页、30个带具体日期与人物。设计目标为相关原页Recall@10至少90%、引用页码正确率至少95%、无答案错误回答率不超过5%;这些是待验证的项目门槛,不是已达成结果。

白天服务与夜间导入

白天问答队列最多2个活跃生成任务,长文有独立预算与排队提示。检索和生成分别计时,设计普通请求P95首字不超过5秒。夜间OCR批任务按卷分页检查点,失败从具体页继续,不重跑整个库。新索引先在影子环境验证,切换后保留旧索引便于回退。

档案更新与错误纠正

原件补扫、OCR纠错和开放级别调整都应产生新版本。索引以文档ID与版本为键,删除旧资料时同步失效检索记录、图片下载权限与相关缓存。员工在界面标记错误回答后,先回到原页确认是扫描问题、文字识别问题还是模型误读,不能直接用新答案覆盖原记录。每月随机抽查100页与20条问答,把重复问题整理成规则回归集;复核后才能调整模型或分块策略。这样系统越用越可靠,而不是只累积更多无法核对的文字。

风险、恢复与交付

首要风险是错字造成错误引用,因此回答显示原页入口与证据片段,用户可以回看。第二是敏感资料泄漏,权限应覆盖检索、图片下载、日志与缓存。第三是OCR版本更新造成索引漂移,升级前复跑500页与150问。

备份同时包含原图、元数据、数据库、索引版本和环境清单。隔离恢复后抽查卷号、页号与哈希,并运行10条固定问题。交付应包含真实处理日志、人工复核差异、失败清单与容量报告,再决定是否增加GPU。方案依据:BGE-M3、Qwen2.5-VL。

案例编制与证据说明

本案例由网昱算力学院按公开技术资料和工程约束编制,用于展示方案设计与验收方法,不对应真实客户项目。配置和性能数字必须在目标硬件、软件版本与业务数据上重新验证。

编制方式
工程模拟
客户授权证据
未提供
原始测试日志
未公开