文档解析出错后,问答还能准吗?ProSA 框架用结构损失衡量影响

0 阅读

文档解析错了,后续问答还能信吗?

企业里的技术手册、设计图纸、操作规范,往往不是纯文字——它们混着表格、示意图、公式和排版结构。当大模型被用来从这些文档里找信息、回答问题时,第一步就是“读”对内容。如果解析器把两段文字错误地拼在一起,或者漏掉一行关键参数,后续的回答再聪明也没用。

文章配图

更麻烦的是,这类错误不容易被发现。工程师可能要回到原始 PDF 才能确认:“咦,这里明明有数据,怎么没读出来?”那么,错误到底发生在哪儿?会不会真的影响最终答案?

文章配图

针对这个问题,中山大学、混沌摆实验室(Chaotic Pendulum Lab)和南洋理工大学的研究人员合作提出了 ProSA(Page-level Robustness for Structured Analysis),一个专门用于评测多模态文档解析鲁棒性的框架。相关论文已被 EMNLP 2026 接收。

文章配图

ProSA 怎么发现解析错误?

文章配图

传统做法是看整体字符错误率,或者统计表格识别准确率。但这些指标很难告诉你:哪一段内容丢了?是不是因为一个小干扰导致前后文被错误拼接?

文章配图

ProSA 的思路很直接:给同一页文档加上可控的干扰(比如擦除一小块区域),然后对比干扰前后的解析结果。它不关心解析器内部怎么工作,只看输出——也就是带位置信息的内容块(text block、table block 等)。

文章配图

具体来说,ProSA 会检查每个原始内容块在干扰后是否还有“有效对应项”。判断标准有两个:

文章配图

  1. 位置是否大致匹配(比如中心点偏移不超过一定阈值);
  2. 文字内容是否保留(比如字符重合度超过设定比例)。

文章配图

如果一个内容块在干扰后完全消失,或者虽然有个框在附近但文字几乎全变了,就算作“结构损失”。所有发生损失的内容块占总块数的比例,就是 块级结构损失率(Block-level Structural Loss Rate, B-SLR)。

这个指标的好处是:不需要额外人工标注。只要有一份干净的解析结果作为参照,就能对任何解析器做对照测试。

研究团队还发现一个反直觉的现象:大面积擦除未必比小面积干扰更危险。比如,擦掉页面角落一大片空白,可能不影响正文;但擦掉某行末尾几个字,却可能导致解析器把下一段开头误接到上一段结尾,造成语义混乱。他们把这种“以干扰面积判断严重性”的倾向称为 Footprint Bias(面积偏见)。

论文中的一个例子显示:右侧仅擦除一行末尾的小区域,导致前后两段文字被错误合并;而左侧大面积擦除反而保留了主要段落结构。

页面只改 0.1%,问答准确率却明显下降

光看解析损失还不够,关键问题是:这会影响实际任务吗?

团队用 MinerU 和 PP-StructureV3 两套主流解析系统,从 349 页真实文档中构建了 975 个抽取式问答对。每个问题的标准答案,在无干扰条件下都能在解析文本中找到。

接着,他们对页面施加两类微小干扰:

  • 普通擦除(AM):随机擦除小区域,平均覆盖页面 0.10%;
  • 结构性干扰(Str.):专门针对段落边界、表格线等关键结构,平均覆盖 0.11%。

面积几乎一样,但影响天差地别。使用 DeepSeek 作为回答模型时,结构性干扰导致问答准确率下降 8.5 到 10.2 个百分点,而普通擦除只降了约 2 点。

更严重的是,在结构性干扰下,约 12%–14% 的问题,其标准答案根本不在解析文本中出现——不是模型答错了,而是“原材料”已经没了。

检索也受影响。在问题所属页面内做 top-5 检索,普通擦除下的答案命中率约 93%,结构性干扰下则跌到 80%–84%。换用其他回答模型(如 Qwen、Llama-3)后,差距依然存在。

B-SLR 比干扰面积更能反映解析变化

既然问答表现和干扰类型强相关,那有没有一个指标能提前预警?

团队在 PubLayNet 和 DocLayNet 数据集上选了 1,000 页文档,对每页应用 29 种固定干扰配置,分别计算干扰面积、B-SLR 和字符错误率(以无干扰解析为基准)。

结果很清晰:B-SLR 与字符错误率的相关性远高于干扰面积

  • 对 MinerU,B-SLR 的拟合 R² 达 0.727,而干扰面积只有 0.384;
  • 对 PP-StructureV3,B-SLR 的 R² 高达 0.916,干扰面积仅 0.110。

即使加入噪声、模糊、JPEG 压缩或亮度变化等非擦除类干扰,B-SLR 依然能稳定反映解析质量的变化。这说明,结构损失确实抓住了影响下游任务的关键信息

如果只能复核部分页面,先看哪些?

现实中,企业不可能对每页文档都人工复核。如果预算只够检查 10% 的页面,该优先看哪些?

ProSA 提供了一种筛选策略:按 B-SLR 从高到低排序,选出损失最严重的页面。

实验模拟了这一过程:在 349 页中选 35 页(约 10%),将它们的受干扰解析结果替换为无干扰版本,其余保持不变。结果发现:

  • 按 B-SLR 选页后,PP-StructureV3 的问答准确率补回了原有损失的 64.8%
  • 随机选页只能补回约 10.3%。

这说明,B-SLR 能有效识别“高风险页面”。当然,实际修复仍需人工介入、重新 OCR 或切换备用解析器——ProSA 不负责修复,只提供诊断信号。

需要注意的是,这种方法依赖两个前提:

  1. 解析器输出必须包含内容块的位置信息;
  2. 需要同时保存原始和受干扰的解析结果。

此外,如果原始解析本身就有错(比如本来就没识别出某个表格),或者两份结果共有的错误,ProSA 无法通过对比发现。

为多系统复用提供统一评测方法

ProSA 的另一个优势是通用性。只要把不同解析器的输出统一转换成“位置+类别+文本”的内容块格式,就能用同一套流程评测。这意味着,企业可以横向比较 MinerU、DocTR、PaddleOCR 等系统的鲁棒性,而不必为每个系统单独设计测试。

对混沌摆实验室来说,这项工作也是其多模态评测体系的一部分。此前,该团队已在 KDD 2025 发表 AlphaAgent,ICLR 2026 发表 AlphaAgentEvo,聚焦递归自我改进(RSI)智能体。如今转向文档解析的可靠性评估,显示出其对“基础输入质量”的重视。

未来,研究者计划在更多类型的企业文档(如 CAD 图纸、电路图、医疗报告)上验证 ProSA,并探索如何将结构损失信号反馈给解析器进行自适应调整。

目前,ProSA 的代码已开源,可供学术界和工业界使用。对于依赖文档智能的企业而言,这或许是一个值得纳入 QA 流程的新工具——毕竟,再强大的大模型,也得先“看清”文档才行