产品派
返回

华为PrismAlign以多视角融合提升表格提取精度

AIInfoQ 中文站2026/9/24 06:51:41
AI 导读

非结构化文档被转化为模型可处理的词元和结构化字段时,提取精度决定了后续训练、检索与生成链路的“有效位宽”。在复杂版式、低质扫描和跨语言混排场景中,单视角视觉语言模型仍可能生成看似合理但与原文不符的表格结果,字段错误率的持续下降也因此成为压缩幻觉风险的关键。

华为团队在EMNLP Industry Track 2026收录的论文《PrismAlign: Prior-Steered Multi-View VLM Alignment for Hallucination-Robust Table OCR》中,提出了PrismAlign框架。它不再依赖单个模型反复增强,而是让多个VLM从不同“视角”观察同一版面,再通过贝叶斯决策层进行一致性对齐;只有在单元格层面形成高置信共识的结果才直接输出,其余结果则保留为低置信状态。

该方法首先将表格结构识别与单元格内容识别拆开处理,分别应对合并单元格、行列拓扑错误和字符、数字误读等问题。随后,系统把行列守恒、A4页面下行列数量的合理上界等表格几何不变量编码为约束,并在推断时计算候选结果的最大后验概率。结构层面还使用TEDS-Structure衡量视角间差异,过滤拓扑明显异常的输出,从而避免模型凭借训练先验擅自补全缺失内容。

与过去主要把多模型用于交叉标注和训练数据清洗不同,PrismAlign将多VLM组合直接放到推理阶段参与决策。论文数据显示,该系统在OmniDocBench 1.5上取得94.62的TEDS、97.30的TEDS-Structure,Overall进入95分区间,并在CC-OCR、PureDocBench的表格任务上达到SOTA。其提升并非主要来自更大的参数规模、更多私有标注数据或更长的处理链,而是来自开源模型之上的多视角贝叶斯融合。

这一设计也适合部署在昇腾系列硬件上,由多个模型并行完成观测,再由决策层进行低延迟归并。面向金融对账单、医疗报告和保险理赔单等高合规场景,系统还能在单元格粒度同时输出结构化文本与置信分数,便于业务按阈值筛选结果,并将低置信内容交由人工复核,形成更可控的Human-in-the-Loop流程。

文档智能多模态模型OCR表格识别

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文