一个多模态大模型能把发票读到95%正确,听起来应付账款流程已经可以交给AI了。但作者Taranpreet Kaur在DEV Community上拆解了完整链路后给出一个反直觉结论:这95%只覆盖了五个步骤里的第一步,后面四步才是运营成本真正堆积的地方。 读取只是第一关 现代多模态LLM确实解决了无模板读取发票的难题。旋转页面、扫描质量差、非常规表格,这些过去需要定制模板才能处理的情况,现在模型可以直接应对。但应付账款流程并不止于读取。 验证、匹配、策略和异常处理,这四步才是决定人力配置的关键环节。它们不是读取任务,模型单独无法完成。一个能95%正确读取发票的模型,只是走完了五个步骤中的第一步。 静默失败比错误更麻烦 模型的结构性局限集中在三个层面。第一是静默置信:当模型找不到某个字段时,它常常返回一个看似合理的值,而这个值并不携带失败信号。第二是表格和行项目漂移:模型会逐行丢失或凭空生成行项目,这种失败发生在行级别而非文档级别,聚合准确率指标会把它完全掩盖。第三是非确定性:相同输入可能产生不同输出,这对财务审计构成治理难题。 这三类问题叠加后,无辅助提取就变得不可行。模型不会主动告诉你哪里没把握,它只是给出一个看起来能用的结果。 模型读取,代码检查 作者推荐的架构是把模型和确定性机制分开。模型负责读取,代码负责检查。算术验证和规范化交给确定性代码处理,实体解析通过模糊匹配阈值对照内部主数据完成,路由依据字段级置信度阈值执行。 人工审核在这个架构里不是后备方案,而是训练数据的来源。作者认为,把人工审核视为架构的一部分而非兜底手段,正是区分一个持续改进系统与一个停滞在模型初始输出系统的关键。 全自动处理率才是人力标尺 字段准确率容易造成误判。一个模型在每张发票三十个字段上达到97%字段准确率,听起来接近完美。但换算到文档级别,只有少数情况下能产出完全干净的发票。每份含一个错误字段的文档仍然需要人工介入。 因此全自动处理率始终远低于所宣称的准确率。决定人员配置需求的不是字段准确率,而是有多少比例的文档可以完全跳过人工。这个数字往往比模型厂商展示的准确率低得多。 特别