文档中的多模态 AI:超越字符识别
文字、表格与图像:多模态 AI 如何辅助文档分析,以及使用前需要核验的内容。

企业文档包含的信息,往往多于复制出来的文字。签名的位置、表格下方的备注、图纸中的箭头或勾选框,都可能改变页面的含义。多模态 AI 因此具有企业应用价值:它尝试把文字与视觉内容联系起来。实际问题是,这种能力在哪些环节能增加价值,又在哪些环节采用传统自动识别方法更容易控制。
识别字符与理解页面
OCR 识别图像中的字符,文档系统随后可以重建行、列和字段。多模态模型则可以接收图像和自然语言指令,回答有关文档的问题。两种方法可以结合使用:提取的文字支持检索,原始页面则保留线性转换可能丢失的信息。选择依据应是具体问题和材料质量,而不是技术名称。
Mathew、Karatzas 和 Jawahar 的 DocVQA 研究于 2020 年提出,并发表于 WACV 2021,研究针对文档图像的问答。它是这一问题的历史参考,并非当前最佳方案的排名。在基准测试中回答正确,不能证明系统能够在无人监督的情况下审批企业文档。
示例:对照技术资料与照片
假设技术部门收到一张零件照片和一份加工说明。这是一个假设场景。第一项任务可以是识别零件类别,并指出说明中相应代码的位置。系统应返回找到的字段、页码和相关图像区域。没有视觉依据的流畅答案,对需要核验材料的人帮助有限。
另一项完全不同的任务,是判断零件尺寸是否满足公差。普通照片未必包含足够的信息:透视、比例和图像畸变都会影响测量。因此,应区分文档识别、含义解释和尺寸检验。模型应能够说明需要仪器测量,而不是根据整体外观推断合格。
先设计输出,再考虑输入
有效试验从预期结果开始。每个答案可以要求给出提取值、单位、文档、页码和核验状态。缺少数据时,应明确标记为未解决。这种格式便于比较不同模型,避免把写作质量与信息准确性混为一谈,也让审核者能够只修改一个字段,而不必重写整段摘要。
还必须保留原件与结果之间的对应关系。如果分析前对页面进行了旋转或裁剪,引用坐标仍应对应用户看到的文档。如果附件被替换,针对旧版本的回答不应被展示成对新版本的解读。这些产品细节直接影响用户对系统的信任。
应寻找哪些错误
样本应包含模糊扫描件、跨页表格、批注、相似缩写,以及版式相同但数值不同的文档。一项有用的检查是有意改变视觉元素而保留主要文字:答案是否在应该变化时发生变化?另一项检查是移除包含信息的页面,观察系统是否承认无法作答。这些测试能够区分真正使用证据与仅仅生成看似合理的答案。
成本应覆盖采集、预处理、分析和审核的完整流程。对于容易读取的字段,逐页进行高分辨率分析可能没有必要;但过度压缩又可能抹去关键备注。一种可测试的策略是先定位相关页面,再进行详细分析。其价值需要通过企业自己的文档库验证。
与 EL-AI 的联系
EL-AI 将 ELAI Nexus介绍为连接文档与项目背景的环境。这种组织方式可以成为研究多模态文档辅助功能的起点。不过,公开页面并未说明产品具有零件自动视觉检验功能:这里的示例是应用设想,并非已发布功能。开展试验需要获得授权的文档、范围明确的问题和共同认可的核验标准。
有价值的结果并不是生成更长的文档描述,而是帮助使用者更容易地找到并核验支持决策的信息,同时识别现有材料何时不足以得出结论。
本文借助 AI 撰写,并核验了所列来源。除非另有说明,应用示例均为假设场景。来源查阅日期:2026 年 9 月 20 日。
封面为 AI 生成的示意图,并非 EL-AI 真实人员、场所或部署的照片。
