level 8
中安未来12138
楼主

OCR能读出一份合同里的所有文字,但它不知道”甲方违约需赔偿乙方损失”里谁是甲方、赔多少、赔的条件是什么。这个问题,大模型能回答。传统OCR和大模型的结合,正在重新定义”文档处理”这件事。
OCR的边界:能识字,不懂字
现代OCR在文字识别上已经相当成熟,印刷体识别准确率普遍在99%以上,就连证件上的MRZ区、发票上的二维码、合同里的印章文字都能可靠读取。
但OCR本质上是个“字符提取器”:它告诉你”这里有什么字”,不告诉你”这些字是什么意思”、”这段和那段有什么关系”、”这份文件有没有合规风险”。
过去,这部分工作由人来做——合同审核员、财务人员、法务、档案管理员。他们靠专业知识和经验,从OCR输出的文字里提取有用信息。
大模型出现之前,也有过NLP(自然语言处理)方法:用预训练语言模型(如BERT)做关键信息抽取、文本分类。效果比规则方法好,但需要为每种文档类型单独标注数据训练,灵活性有限。
大模型改变了什么?
大模型(GPT-4、Claude、Qwen等)带来了三个关键改变:
一是零样本/少样本理解。不需要大量标注数据,只需要用自然语言描述任务(”请提取这份合同中的甲乙双方名称、合同金额、违约条款”),大模型就能完成结构化抽取。这让新类型文档的处理,从”需要几个月建模”变成”几分钟写提示词”。
二是语义推理。大模型不只是找关键词,而是理解上下文。”合同期限为两年,自2023年3月1日起”——大模型能推算出到期日是2025年3月1日,传统方法需要写专门的时间解析规则。
三是多模态理解。最新的多模态大模型(如GPT-4o、Qwen-VL)直接接受图片输入,不需要先经过OCR再输入文字,对复杂版式、破损图像、手写内容的处理更灵活。
实际的技术架构:OCR + 大模型流水线
在实际系统中,两者通常是协作关系,而非替代关系:
第一步,OCR处理:高质量地提取文档中的所有文字和版面结构(区域划分、阅读顺序、表格单元格等)。这一步用专业OCR引擎,准确率高、速度快。
第二步,大模型理解:把OCR输出的结构化文本(带版面信息)连同任务指令一起发给大模型,由它完成语义理解、关键信息抽取、风险判断、摘要生成等高层次任务。
第三步,结果验证与入库:大模型输出的结构化结果,经过规则校验后写入业务系统。对置信度低的结果标注,交人工复核。
这条流水线兼顾了OCR的效率准确性,和大模型的语义理解能力。
落地场景:从”抄字”到”读懂”
合同智能审核:法务团队不再逐行读合同找风险条款,系统自动提取合同要素、标记异常条款、对比标准合同模板,15分钟的审核工作缩短到1分钟。
财报智能分析:上市公司财报PDF识别后,大模型自动抽取关键财务指标、同比变化、异常项,生成分析摘要,分析师聚焦判断而非数据整理。
保险理赔:理赔材料(病历、发票、证件)扫描后,OCR+大模型联合评估资料完整性、核实关键信息、识别可疑欺诈模式,加速理赔审核流程。
智能客服知识库:企业文件(产品手册、操作规程、FAQ)批量OCR识别后,输入大模型建立语义检索知识库,客服机器人能精准回答”第3.2章怎么配置”这类细粒度问题。
这条路的局限和方向
大模型也有弱点:对超长文档(百页合同)处理成本高;对数字精确性(金额、日期)有时不够稳定;对专业领域术语理解依赖预训练数据的覆盖度。
解决方向是RAG(检索增强生成):先用向量检索找到文档里最相关的段落,再让大模型专注在小范围内理解,既节省成本,又提升准确性。
OCR让文字从纸上”出来”,大模型让文字的意思”流起来”。两者结合,文档不再是被动存档的资料,而是随时可以被查询、被理解、被分析的知识资产。