Together_CZ头像
关注
GLM-OCR Technical Report封面图

GLM-OCR Technical Report

GLM-OCR 技术报告核心总结

1. 研究目标与定位
GLM-OCR 是一款面向现实世界文档理解任务的轻量级、高效率多模态OCR模型。核心目标是在不依赖大模型规模的前提下,通过架构创新和系统优化,同时满足生产环境对高性能、高吞吐、低延迟、易部署的综合性需求。模型总参数量仅为 0.9B(视觉编码器0.4B + 语言解码器0.5B)。

2. 核心技术创新

  • 多令牌预测(Multi-Token Prediction, MTP):针对OCR任务确定性强、局部依赖高的特点,引入MTP机制,让模型每一步同时预测多个令牌(训练时10个,推理时平均5.2个)。通过参数共享控制内存开销,最终带来约50%的推理吞吐量提升,同时改善结构化输出的完整性(如减少表格标签断裂)。

  • 两阶段文档解析流程:先使用PP-DocLayout-V3进行版面分析,将复杂页面分解为独立区域(段落、表格、公式等),再对每个区域并行调用核心模型进行识别。这种设计既降低幻觉风险,又提升处理效率,还增强了复杂版面的鲁棒性。

  • 统一的生成式任务框架:将文档解析(输出Markdown/JSON)和关键信息提取(输出结构化JSON)统一表述为“视觉输入 + 任务提示 → 结构化输出”的条件生成问题,仅在预处理和提示设计上有所区分。

3. 训练策略(四阶段渐进式优化)

阶段内容关键点
阶段1视觉编码器预训练数十亿图文对,MIM+CLIP双目标,知识蒸馏
阶段2.1视觉-语言联合预训练图文、文档解析、定位、VQA数据对齐多模态表示
阶段2.2引入MTP的预训练使解码器适应高效结构化生成
阶段3监督微调(SFT)在文本/公式/表格识别、KIE数据上微调,保持MTP一致性
阶段4强化学习(GRPO)任务感知奖励函数(编辑距离、CDM、TEDS、字段F1等),提升输出可靠性与结构化验证

4. 性能表现

  • 公共基准:在OmniDocBench v1.5(94.6)上排名第一,超越PaddleOCR-VL-1.5、MinerU2.5及Qwen3-VL-235B等更大模型;在OCRBench Text、UniMERNet、TEDS_TEST上也取得领先;在KIE任务(Nanonets-KIE、Handwritten-KIE)上达到开源模型SOTA。

  • 内部现实场景:在代码文档、现实表格、手写文本、多语言、印章识别、收据KIE六类任务中,五项取得开源模型最佳,尤其在印章识别(90.5)和多语言(69.3)上大幅领先。

  • 吞吐量:PDF输入1.86页/秒,图像输入0.67张/秒,显著优于同类模型。

5. 部署与使用

  • 本地部署:支持vLLM、SGLang、Ollama等框架,提供完整SDK。

  • 云端MaaS:定价0.2元/百万token,成本约为传统OCR解决方案的十分之一。

  • 微调支持:基于LLaMA-Factory,提供领域适配能力。

  • 两种使用范式:SDK用于完整文档解析流程;基础模型直接调用用于轻量级OCR和灵活的信息提取。

6. 主要局限性

  • 两阶段架构的误差传播:版面检测错误会影响下游识别。

  • 数据覆盖:对极低分辨率、复杂公式、不规则表格、低资源语言的表现受限。

  • 生成可变性:格式化细节(如换行、空格)存在轻微随机性。

  • KIE依赖提示质量:字段边界模糊时可能产生不完整或冗余输出。

GLM-OCR 的价值在于证明:通过精心设计的架构(MTP)、系统化的流程(两阶段版面分析+并行识别)以及针对性的训练策略(多阶段+RL),一个小规模模型可以在文档理解的关键任务上达到甚至超越大模型的表现,同时在推理效率、部署灵活性和运营成本上具备显著优势。 这为OCR技术在大规模生产环境和资源受限场景下的落地提供了一条务实且高效的路径。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

项目地址在这里,如下所示:

模型权重发布地址在这里,如下所示:

摘要

GLM-OCR 是一款高效的 0.9B 参数紧凑型多模态模型,专为现实世界的文档理解而设计。它结合了 0.4B 参数的 CogViT 视觉编码器和 0.5B 参数的 GLM 语言解码器,在计算效率和识别性能之间实现了良好的平衡。为了解决标准自回归解码在确定性 OCR 任务中的低效问题,GLM-OCR 引入了一种多令牌预测(MTP)机制,该机制每步预测多个令牌,通过共享参数在保持较低内存开销的同时,显著提高了解码吞吐量。在系统层面,采用了两阶段流程:PP-DocLayout-V3 首先进行版面分析,随后进行并行的区域级识别。在公共基准测试和工业场景中的广泛评估表明,GLM-OCR 在文档解析、文本和公式转录、表格结构恢复以及关键信息提取方面达到了具有竞争力或最先进的性能。其紧凑的架构和结构化生成能力使其既适用于资源受限的边缘部署,也适用于大规模生产系统。

图 1:GLM-OCR 在 OmniDocBench v1.5 上的性能表现。

1 引言

文档理解是现代信息系统中的核心能力,支持从财务报告、科学文章、合同和发票等视觉丰富、版面复杂的文档中提取和构建知识。传统的 OCR 系统 [29; 12; 6] 主要关注纯文本转录,并依赖多阶段流程和基于规则的启发式方法进行版面解析和下游信息提取。虽然这些方法在简单场景下有效,但在处理复杂布局、多样化文档格式和满足现实生产需求时往往力不从心。

近期的多模态大语言模型(MLLMs)[2; 31; 30] 将视觉感知和语言理解统一在单一框架内,显著提升了文档理解性能。然而,它们庞大的模型规模和自回归解码范式导致了高昂的计算成本、缓慢的推理速度和巨大的内存消耗,这使得在高并发或边缘环境下进行大规模部署颇具挑战。

在实际生产系统中,文档智能解决方案必须同时提供:(1)对表格、公式、代码和印章等复杂内容的强大处理能力;(2)高吞吐量和低延迟的推理;(3)灵活的集成和领域适应能力。GLM-OCR 的开发正是为了在一个统一的多模态框架内满足这些系统级需求。

GLM-OCR 是一款用于全面文档理解的轻量级多模态 OCR 模型。它基于 GLM-V 编码器-解码器框架 [31],结合了一个在大规模图文数据上训练的 0.4B 规模的 CogViT 视觉编码器、一个轻量级的跨模态连接器以及一个 0.5B 规模的 GLM 语言解码器 [9]。整个模型仅包含 0.9B 参数,能够在保持强大识别性能的同时,实现高吞吐量和低延迟推理。

除了架构优化,GLM-OCR 还考虑了传统自回归生成与 OCR 任务特性之间的不匹配。OCR 本质上是一个确定性任务,具有强烈的局部依赖性和明确的结构化监督,严格的自回归逐令牌解码效率低下。因此,我们在训练和推理中都引入了多令牌预测(MTP)[15]。MTP 能够同时预测多个令牌,在保持识别精度的同时,大幅提升了训练效率和解码吞吐量,尤其适用于表格等长结构化输出。为控制 MTP 带来的额外内存开销,我们进一步在辅助模型间采用了参数共享方案,显著降低了额外的 GPU 内存占用 [35]。在实际应用中,GLM-OCR 训练时每步预测十个令牌,推理时平均每个解码步骤生成 5.2 个令牌,带来了约 50% 的吞吐量提升。

在系统层面,GLM-OCR 采用了两阶段流程,包括版面分析和并行内容识别。版面阶段由 PP-DocLayout-V3 [7] 驱动,它检测结构化区域并支持跨不同文档区域的并行识别。这种设计提高了复杂现实文档处理的鲁棒性和处理效率。

成果。图 2 显示,尽管 GLM-OCR 仅有 0.9B 的紧凑尺寸,但在 OmniDocBench v1.5 [24] 上取得了 94.6 的分数,在所有评估模型中排名第一。此外,GLM-OCR 在文本识别、公式识别、表格解析和关键信息提取方面均表现出色,在 OCRBench (Text) [17] 上达到 94.0,在 UniMERNet [32] 上达到 96.5,在 PubTabNet [36] 上达到 85.2,在 TEDS 上达到 86.0。它在信息提取基准测试(如 Nanonets-KIE 和 Handwritten-Forms [18])上也表现出竞争力,性能可与显著更大的通用多模态模型相媲美。

除了公共基准,我们还在六个高频现实世界场景中对 GLM-OCR 进行了评估,包括代码文档解析、自然场景表格识别、手写文本识别、多语言 OCR、印章识别和收据 KIE。GLM-OCR 在所有设置中均 consistently 取得了优异结果,在现实世界表格识别上达到 91.5,印章识别上达到 90.5,收据 KIE 上达到 94.5。这些结果表明,GLM-OCR 不仅适用于精选基准,而且在实际生产条件下依然保持有效。

2 方法

在本节中,我们介绍 GLM-OCR 框架的整体设计,包括其架构组件、任务表述和训练策略。我们首先阐述指导我们系统设计的核心理念,随后详细描述模型架构和特定任务的流程。最后,我们详细阐述多阶段训练策略,该策略逐步对齐视觉和语言表示,增强结构化生成能力,并通过监督学习和强化学习优化任务性能。

图 2:GLM-OCR 框架的整体架构和工作流程。该系统支持两个主要任务:文档解析(任务 1),它结合了版面检测和区域裁剪,生成结构化的 Markdown 和 JSON 输出;以及关键信息提取(任务 2),它基于输入的视觉提示直接提取结构化的 JSON 数据。

2.1 模型概述

为了全面理解 GLM-OCR 架构,我们首先讨论我们方法背后的主要设计原理,然后详细描述模型结构及其在不同任务中的执行过程。

动机。文档理解领域的三个基本观察和目标指导了我们的架构设计:

  1. 在文档解析中整合版面分析:实践中,我们观察到小规模模型在处理复杂版面的文档时,极易产生幻觉和重复生成。通过在识别前显式引入版面分析模块,我们将复杂的版面结构分解为多个更简单的子问题,显著提升了模型的整体性能和稳定性。此外,将大型复杂页面分割成较小的独立区域,可以实现并行识别,从而大幅提高推理效率。

  2. 融入关键信息提取(KIE):文档解析和 KIE 都可被表述为基于视觉输入的条件结构化生成问题。文档解析侧重于重建文档的完整结构表示(例如,Markdown)

  3. 采用多令牌预测(MTP):标准的 LLM 解码每次生成一个令牌,这对于长篇文档生成来说计算成本高且速度慢。我们采用多令牌预测(MTP)来解决两个主要挑战:

    • 推理速度:通过同时预测 k 个令牌,我们显著减少了总解码步数。

    • 上下文建模:MTP 鼓励模型进行更长远的规划。这在 OCR 任务中尤其有益,因为结构化令牌(例如,表格标签或 Markdown 语法)表现出强烈的局部依赖性。因此,这种方法产生了更少的“残缺”标签,并生成更鲁棒的结构化输出。

架构。如图 2 所示,该系统以 GLM-OCR 核心为中心,遵循视觉-语言生成范式。核心模型包括:

  • 视觉编码器(CogViT,400M 参数):负责从文档图像中提取高级视觉表示。

  • LLM 解码器(GLM,500M 参数):一个自回归语言模型,根据视觉嵌入和文本提示生成结构化的文本输出。

编码器产生的视觉特征被投影到语言嵌入空间,并作为前缀令牌馈送到解码器中。在解码过程中,模型以自回归方式生成结构化输出(例如,Markdown 或 JSON)。

为了提高解码效率和结构一致性,我们引入了一种多令牌预测(MTP)机制。除了主预测头外,我们还附加了 k 个共享参数的辅助头,这些辅助头同时预测接下来的 k 个令牌。这些头共享相同的参数,但被训练用来建模不同的未来偏移量。在推理过程中,这使得模型每步能生成多个令牌,从而减少延迟,同时促进更好的局部结构连贯性。

该框架在统一的生成式表述下支持两个主要任务:

任务 1:文档解析。

给定一张文档图像,流程首先使用 PP-DocLayoutV3 进行版面分析,将文档分解为语义连贯的区域(例如,段落、表格、公式)。每个区域由 GLM-OCR 核心独立处理。

随后,合并与后处理模块聚合生成的区域输出,恢复阅读顺序,并生成 Markdown 和 JSON 格式的结构化输出。这种模块化设计降低了幻觉风险,提高了对复杂版面的鲁棒性,并实现了文档区域的并行处理。

任务 2:关键信息提取。

对于 KIE,完整的文档图像与特定任务的文本提示(例如,指示模型以 JSON 格式提取发票字段)一起直接输入到 GLM-OCR 核心。与文档解析不同,此任务不依赖于显式的区域裁剪。相反,模型在提示的引导下,学习隐式地关注相关的视觉区域。

因此,这两个任务都被统一为条件结构化生成问题,仅在预处理策略和提示规范上有所不同。

2.2 训练方案

GLM-OCR 的训练过程分为几个不同的阶段,系统地推进从视觉-语言对齐到任务特定优化和强化学习的进程。详细的训练方案,包括每个阶段的数据类型、学习率和训练规模,总结在表 1 中。

表 1:GLM-OCR 不同阶段的训练方案。

阶段 1:视觉编码器训练。我们首先使用大规模图文对和定位数据训练视觉编码器,以建立强大的视觉表示能力。在此阶段,模型在规模达数百亿的图文对数据集上进行训练。训练结合了 MIM 和 CLIP 任务的双重目标。此外,我们采用知识蒸馏技术,从一个内部更大参数量的 ViT 模型中蒸馏知识,以进一步增强编码器的特征提取能力。

阶段 2:视觉-语言预训练。在阶段 2.1 中,我们将 GLM-0.5B 附加到视觉 Transformer(ViT)上,并在图文对、文档解析、定位和 VQA 数据上联合预训练完整模型,以对齐多模态表示。在阶段 2.2 中,我们引入多令牌预测(MTP)目标,使解码器适应高效的结构化生成。

阶段 3:监督微调(SFT)。在此阶段,我们在精心整理的有关文本识别、公式转录、表格结构恢复和关键信息提取的 OCR 数据集上微调模型。目标是使模型专精于在现实文档分布下生成高精度的结构化输出。多令牌预测保持启用状态,以确保训练和推理之间的一致性。数据混合经过平衡处理,以防止对任何单一子任务过拟合并保持跨任务的泛化能力。

阶段 4:强化学习(RL)。最后阶段应用 GRPO [28] 来提高结构化输出的可靠性和特定任务的准确性。训练样本通过从 SFT 模型进行 rollout 生成,自动评估,并按难度分层以构建分级优化集。

奖励函数是任务感知的,并集成了基于准确性的指标和结构验证信号。其设计总结在表 2 中。

表 2:阶段 4 RL 训练中的奖励函数设计。

3 评估

在本节中,我们将 GLM-OCR 的性能与当前最先进的流程工具、通用视觉-语言模型(VLMs)和专用 OCR VLMs 进行评估。为了进行全面评估,评估分为两部分:标准公共基准和定制内部基准。

表 3:各种 OCR 模型的性能比较。Gemini-3-Pro 和 GPT5.2-2025-12-11 的结果以灰色显示,仅供参考,不参与最佳分数排名。评估模型中最佳结果以粗体突出显示。

3.1 公共基准

我们首先在包含文档解析和 KIE 任务的广泛认可的公共数据集上评估 GLM-OCR。

整体基准性能。如表 3 所示,GLM-OCR 在大多数标准数据集上展现了优越的性能。在文档解析方面,我们的模型在 OmniDocBench v1.5 (94.6)、OCRBench Text (94.0)、UniMERNet (96.5) 和 TEDS_TEST (86.0) 上取得了最高分。在 PubTabNet (85.2) 上,它紧随 MinerU 2.5 之后,表现极具竞争力。此外,GLM-OCR 在 KIE 领域确立了明确的 SOTA 地位,在 Nanonets-KIE (93.7) 和 Handwritten-KIE (86.1) 上优于所有可用的开源竞争对手,甚至缩小了与闭源巨头(如 Gemini-3-Pro)的差距。

OmniDocBench v1.5 分析。为了更好地理解模型的文档解析能力,我们在表 4 中展示了 OmniDocBench v1.5 结果的细粒度分解。该基准比较了流程工具、不同规模的通用 VLM 以及专用 VLM。

值得注意的是,尽管仅拥有 0.9B 参数,GLM-OCR 取得了最高的总体分数(94.62),不仅超越了直接的专用竞争对手如 PaddleOCR-VL-1.5 (94.50) 和 MinerU2.5 (90.67),也超越了大规模的通用 VLM 如 Qwen3-VL-235B (89.15) 和 Gemini-3 Pro (90.33)。

子指标细分显示其在表格结构恢复方面的强大性能。它在表格识别上取得了绝对最佳分数,Table TEDS​ 得分为 93.96,Table TEDS−S​ 得分为 96.39。尽管 PaddleOCR-VL-1.5 在 Text Edit​ (0.035 vs 0.040) 和 Formula CDMCDM​ (94.21 vs 93.90) 上略微优于 GLM-OCR,但 GLM-OCR 卓越的表格解析能力巩固了其作为整体表现最佳模型的地位,证明了专门的、参数高效的架构能够在复杂文档解析方面与规模庞大的模型相抗衡甚至超越。

3.2 内部基准

为了评估 GLM-OCR 在高度复杂的现实世界工业场景中的鲁棒性,我们在一个定制的内部基准套件上进行了评估。这些任务包括代码文档解析、现实世界表格提取、手写文本识别、多语言文本处理、印章识别和收据 KIE。

如表 5 详细所示,在比较的开源权重模型中,GLM-OCR 在六个评估类别中的五个类别中取得了最高分。最值得注意的是,GLM-OCR 在具有挑战性的专业领域展现出显著优势:

  • 印章识别:GLM-OCR 取得了 90.5 的卓越分数,以巨大优势领先于次优的开源权重模型(dots.ocr 为 63.0),并与 Gemini-3-Pro (91.3) 表现相当。

多语言文本:该模型在各种语言环境中表现出色,得分为 69.3,而 PaddleOCR-VL-1.5 为 54.8。

复杂格式:它在代码文档解析(84.7)和现实世界表格提取(91.5)方面领先,证明了其在高度结构化和嘈杂环境中的实用性。

尽管 PaddleOCR-VL-1.5 在手写文本(87.4 vs. GLM-OCR 的 87.0)方面保持了微弱的领先优势,但 GLM-OCR 仍然非常有效。至关重要的是,在收据 KIE 等实际应用任务中,GLM-OCR (94.5) 轻松超过了 GPT-5.2 (83.5) 等专有模型。这些内部结果验证了 GLM-OCR 不仅仅是为学术数据集优化的,而且具有很强的泛化能力,能够应对现实世界 OCR 部署中嘈杂、多变的条件。

4 推理与部署

4.1 本地部署与 SDK 集成

GLM-OCR 具有 0.9B 的紧凑参数量,针对本地化推理和资源受限环境进行了高度优化。该模型支持在主流框架上进行高效部署,包括 vLLM、SGLang 和 Ollama。为促进无缝集成,我们提供了一个全面的 SDK,用于端到端的文档解析工作流 8。

为了评估运营效率,我们对各种 OCR 流程进行了比较吞吐量分析。在相同的硬件配置和测试条件下(单副本,单并发),我们评估了图像和 PDF 输入的解析和 Markdown 导出速度。如表 6 所示,GLM-OCR 优于其他方法,PDF 文档吞吐量达到 1.86 页/秒,独立图像文件吞吐量达到 0.67 张图像/秒。

表 6:不同 OCR 模型在图像和 PDF 输入下的吞吐量比较。

4.2 模型即服务(MaaS)API

对于基于云的部署,GLM-OCR 可通过 MaaS API 9 访问。该服务采用极具成本效益的统一定价模式,输入和输出令牌均为 0.2 元人民币/百万令牌。在此定价结构下,花费 1 元人民币即可处理约 2,000 张 A4 大小的扫描图像或 200 个简单版面的 PDF 文件(每份 10 页)。这代表了运营开销的显著降低,处理成本降至传统 OCR 解决方案的大约十分之一。

4.3 微调能力

在需要特定领域适配或增强任务性能的场景下,GLM-OCR 支持利用 LLaMA-Factory 框架进行直接微调。关于微调过程的全面教程和配置指南可在官方代码库中获取:https://github.com/zai- org/GLM-OCR/blob/main/examples/finetune/README.md。

5 预期使用场景

5.1 概述

GLM-OCR 旨在支持高级文档理解工作流和轻量级光学字符识别(OCR)任务。根据应用需求,用户可以(1)集成 GLM-OCR SDK 以构建复杂的文档解析流程,或(2)直接调用基础模型进行针对性的识别和结构化信息提取任务。本节描述这两种主要使用范式及其代表性应用场景。

5.2 使用 GLM-OCR SDK 进行文档解析

GLM-OCR SDK 10 提供了一个全面的接口来执行文档解析,包括版面感知解析、多模态识别和结构化输出生成。它适用于企业级或生产级工作流,其中文档可能包含异构内容,如段落、表格、数学表达式和键值对。输出以结构化的 Markdown 格式生成,保留了逻辑文档层次结构和结构关系。该示例表明,SDK 支持对异构文档进行端到端解析,同时保持结构保真度和语义连贯性。

图 3:GLM-OCR SDK 用于复杂文档解析的示例。

5.3 使用基础模型进行轻量级 OCR 和信息提取

除了 SDK,GLM-OCR 还可以直接用作独立模型,用于轻量级 OCR 和针对性提取任务。此模式适用于需要较低集成开销、灵活提示或快速原型制作的场景。

此模式下的所有任务都通过明确的提示指令进行控制。下面我们描述四种主要任务类别。

5.3.1 文本识别

提示:

文本识别:

此模式用于通用的印刷或手写文本转录。模型输出与输入图像中可见文本内容相对应的纯文本。

示例场景。图 4 展示了一个使用餐厅菜单板的现实世界文本识别场景,菜单包含多语言内容(例如,意大利菜名和英语短语)以及带有特殊字符(例如,欧元符号)的价格标注。输入图像呈现出典型挑战,如手写风格字体、不同的字符大小、不均匀的间距、透视失真和背景杂乱。

尽管存在这些复杂性,模型仍能准确转录文本内容,同时保留原始行结构和语义分组。特别地,它正确重建了换行符、大小写、标点符号、数值和货币符号(例如,“5,10€”、“14,00”),展示了对布局变化和适度视觉噪声的鲁棒性。此示例突显了该模型在无约束的现实世界环境中执行可靠光学字符识别的能力。

5.3.2 表格识别

提示:

表格识别:

图 4:GLM-OCR 文本识别示例。

此任务侧重于恢复表格数据的结构表示。输出可以格式化为 Markdown 表格或保留行列对齐的结构化文本。

图 5:GLM-OCR 表格识别示例。 

示例场景。图 5 展示了一个临床总结表格,包含层次化列标题、合并单元格、百分比值、缺失值指示符和统计注释(例如,p 值)。输入图像呈现出典型的文档分析挑战,包括低对比度、密集的数字内容、多级标题分组以及复杂的行列对齐。

GLM-OCR 通过识别列组(例如,手术与非手术队列)、保留标题层次结构,并将数值条目与其对应属性正确对齐,准确地重建了逻辑表格结构。除了忠实地转录单元格内容外,模型还保持了结构一致性,如行序、列对应关系和百分比值配对。这种结构化重建能够直接转换为机器可读格式(例如,CSV 或电子表格),从而促进下游统计分析、数据验证和自动化报告工作流。

5.3.3 公式识别

提示:

公式识别:

此模式用于识别数学表达式并将其转换为结构化格式(例如,LaTeX)。

图 6:GLM-OCR 公式识别示例。 

示例场景。给定一张包含科学手稿中行内公式和展示公式的图像,模型将公式转录为语法正确的 LaTeX 表达式。输出保留了运算符、上标、下标和分数结构,便于在学术或技术文档中直接复用。

如图 6 所示,给定一张包含密集数学方程式的图像,GLM-OCR 将视觉内容准确转录为语法正确的 LaTeX 表达式。该模型在解析复杂的二维空间布局方面展示了高保真度,成功保留了诸如矩阵、行列式和多级下标等复杂结构元素。这种精确重建消除了手动校正的需要,使得能够直接无缝地在学术和技术文档中复用。

5.3.4 关键信息提取

对于结构化信息提取任务,提示必须明确指定严格的 JSON 模式。模型应生成符合提供格式的输出。

示例场景。在一个涉及密集海关申报单的代表性示例中,模型根据详细的输入提示成功提取了结构化字段。它直接从视觉布局中准确填充了复杂的嵌套 JSON 实体,如托运人详细信息、统一社会信用代码和分项货物信息。输出严格遵循用户提供的 JSON 模式,消除了幻觉键,并促进了无缝集成到自动化处理流程或结构化数据库中。

5.4 使用范式总结

这两种使用模式满足互补的需求:

  • GLM-OCR SDK 专为生产环境中全面、版面感知、多元素文档解析而设计。

图 7:GLM-OCR 关键信息提取示例。

  • 基础模型提示使得轻量级、灵活的 OCR 和针对性信息提取成为可能,适用于模块化或特定任务的应用。

总之,这些范式使 GLM-OCR 能够支持广泛的文档理解工作流,从快速原型制作到企业级部署。

6 局限性

尽管 GLM-OCR 在多样化的基准和实际场景中展示了具有竞争力的性能,但仍存在若干局限性。

6.1 两阶段架构的约束

当前的两阶段流程,包括版面分析后跟区域级识别,可能会引入错误传播。在版面检测不准确的情况下,下游识别性能可能会下降。此外,涉及跨页依赖或不规则多栏结构的复杂版面可能导致阅读顺序重建不完美。

6.2 数据覆盖范围的局限性

模型性能受训练数据分布和多样性的影响。在以下场景中性能可能会下降:

  • 极低分辨率或严重失真的文档,

  • 高度复杂的数学表达式,

  • 密集或不规则的表格结构,

  • 训练语料库中代表性不足的语言。

6.3 结构化输出的可变性

作为一个生成模型,GLM-OCR 可能在格式行为上表现出轻微的随机变化,特别是在换行符和空格处理方面。尽管强化学习和结构化监督缓解了这种影响,但无法完全保证严格的格式一致性。

6.4 关键信息提取

虽然该模型支持基于提示的 KIE,但提取准确性取决于提示的规范和模式的清晰度。在具有隐式或模糊字段边界的复杂表单中,可能会出现不完整或冗余的输出。

这些局限性代表了持续研究和系统完善的方向。

这些局限性代表了持续研究和系统完善的方向。

7 结论

本报告介绍了 GLM-OCR,作为在现实世界系统约束下进行结构化文档理解的一种实用解决方案。该设计不依赖大规模模型扩展,而是优先考虑可控的延迟、内存效率和结构化输出的可靠性。通过版面感知预处理和多令牌解码的结合,该系统提高了吞吐量和稳定性,同时在多样化的文档类型中保持了具有竞争力的识别准确性。结果表明,模型架构、解码策略和任务结构之间的精心协调可以在不增加参数规模的情况下带来显著的效率提升。

从工程角度来看,GLM-OCR 表明文档智能系统受益于模块化流程、高效的生成机制和面向部署的优化。该模型支持本地推理、基于云的服务以及特定领域的微调,使其能够集成到异构生产环境中。未来的发展将侧重于提高极端布局复杂性下的鲁棒性、增强多语言覆盖范围,以及加强结构化输出的一致性,以进一步降低下游集成成本。

转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/Together_CZ/article/details/163210500

文章来源crawl

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--