郭震 AI公众号:郭震AI

实时 AI 消息

智谱 GLM-OCR 模型页更新:0.9B 参数在 OmniDocBench V1.5 登顶

智谱旗下开源组织 zai-org 在 Hugging Face 上的 GLM-OCR 模型页于9月11日更新,这款面向复杂文档理解的多模态 OCR 模型以 0.9B 参数在 OmniDocBench V1.5 上取得 94.62 分、位列第一。模型基于 GLM-V 编码器—解码器并叠加 PP-DocLayout-V3 版面分析流水线,官方给出 vLLM、SGLang、Ollama 等部署路径,页面下载量已接近 189 万次。

发布时间
智谱 GLM-OCR 模型页更新:0.9B 参数在 OmniDocBench V1.5 登顶
图源: huggingface.co

智谱旗下的开源组织 zai-org 在 Hugging Face 上的 GLM-OCR 模型页于9月11日更新,模型卡给出了完整的架构说明、评测数字与部署方式。这是一款面向复杂文档理解的多模态 OCR 模型,页面标签显示其任务类型为图文转文本(image-text-to-text),库依赖为 transformers,支持中文、英文、法文、西班牙文、俄文、德文、日文和韩文八种语言,模型本体采用 MIT 许可。

架构上,GLM-OCR 建立在 GLM-V 编码器—解码器之上。它集成了在大规模图文数据上预训练的 CogViT 视觉编码器、一个带高效 token 下采样的轻量跨模态连接器,以及 GLM-0.5B 语言解码器;训练侧引入多 token 预测(MTP)损失与稳定的全任务强化学习,官方称这套组合提升了训练效率、识别准确率和泛化能力。

性能是这次更新最受关注的部分。模型卡显示,GLM-OCR 在 OmniDocBench V1.5 上取得 94.62 分、位列第一,并在公式识别、表格识别与信息抽取等主要文档理解基准上达到同类最佳水平。官方同时强调它对真实业务场景的适配,称其在复杂表格、代码密集文档、印章等棘手版面上依然保持稳定表现。

工程实现上,GLM-OCR 走的是两阶段流水线:先由 PP-DocLayout-V3 做版面分析,再进行并行识别。智谱为此提供官方 SDK,把版面分析与结构化输出封装成一条相对完整的链路,托管 API 则挂在 docs.z.ai 上。模型目前支持两类提示场景——文档解析(文字、公式、表格识别)与信息抽取,后者要求输出严格遵循给定的 JSON schema,以保证下游处理可用。

效率与部署成本是它的另一个卖点。GLM-OCR 只有 0.9B 参数,官方称可显著降低推理时延与算力开销,适合高并发服务与边缘部署,并给出了 vLLM、SGLang、Ollama 与 Transformers 四条部署路径。在单副本、单并发的统一测试条件下,它解析 PDF 的吞吐为每秒 1.86 页,处理图片为每秒 0.67 张。模型本体以 MIT 许可开放,流水线中用到的 PP-DocLayout-V3 则遵循 Apache 2.0 许可。

从采用情况看,这个模型页已经积累了相当规模的社区使用:下载量约 189 万次,点赞数为 2026。对于文档智能这类落地密集的赛道,小参数加高精度的组合意味着企业可以把 OCR 能力放进自有集群甚至边缘设备,而不必为通用大模型付出高昂的推理成本,这让它在票据、合同、报表、证件等场景中更具可操作性。

后续值得关注的有两点。其一,模型卡引用了编号 2603.10910 的技术报告,方法细节与消融实验仍要回到论文中核对;其二,官方 SDK 目前只覆盖文档解析任务,信息抽取仍需直接调用模型并按 schema 约束输出,这套工具链能否进一步收拢,将决定它在真实生产管线里的上手成本。

为什么重要

GLM-OCR 把文档理解的门槛压到了 0.9B 参数级别,企业可以在自有算力上跑出接近顶尖的 OCR 精度,这会加速票据、合同、报表等场景的私有化部署,也让开源文档智能与商用闭源 API 之间的成本差距进一步拉开。

微博邮件

Zhipu GLMGLM-OCROCROpen SourceMultimodal
返回AI日报

附近消息

全部

09/11 18:00

OpenAI 详解存储系统 Habitat:如何撑起 10 亿 ChatGPT 用户与每秒 2200 万次请求

9月11日,OpenAI 发布工程博客,讲述在线存储系统 Habitat 如何从 Python 库演进为全球分布式存储平台,用来支撑 ChatGPT 的运行。文中给出的关键数据是:Habitat 目前服务超过 10 亿 ChatGPT 用户,并承载每秒 2200 万次请求。

09/11 16:59

高德扫街榜全面AI化,背后是全球首个3D原生城市世界模型ABot-Earth 0.7

高德9月10日宣布,上线一年的扫街榜全面AI化,2026版用AI算法理解不同导航到店行为的评分权重,更精准体现用户的真实选择。支撑这次升级的是高德空间智能的核心引擎ABot-Earth 0.7,团队称其为全球首个3D原生城市世界模型,仅需一张卫星图或一段文字,就能在消费级GPU上用约10分钟生成带真实街景的3D城市。

09/11 22:05

Anthropic 开出最高约 320 万元年薪招销售,只为服务 Meta 一家客户

Anthropic 近日在招聘页面挂出名为「Mega Account Executive, Meta」的岗位,面向的客户只有 Meta 一家,年收入区间为 38 万至 45 万美元(按 OTE 机制计算),最高约合人民币 320 万元。该岗位 9 月 3 日上线、9 月 9 日即停止接受申请,而 Meta 工程师已在大量使用 Claude Code,据《纽约时报》消息其在 Anthropic 上的潜在年支出可能达到 100 亿美元。

09/11 13:53

Anthropic称已阻止AI被用于网络攻击和生物武器用途

据Euronews报道,Anthropic表示已经阻止了自家AI被用于网络攻击以及生物武器相关的滥用行为。这一披露再次把前沿模型的滥用监测与拦截能力推到台前。