245.1K 2个月前

GLM-OCR 是一个基于 GLM-V 编码器-解码器架构构建的,用于复杂文档理解的多模态 OCR 模型。

视觉 工具
ollama run glm-ocr

应用

Claude Code
Claude 代码 ollama launch claude --model glm-ocr
Codex
Codex ollama launch codex --model glm-ocr
OpenCode
OpenCode ollama launch opencode --model glm-ocr
OpenClaw
OpenClaw ollama launch openclaw --model glm-ocr

自述文件

logo.svg

GLM-OCR 是一种基于 GLM-V 编码器-解码器架构的多模态 OCR 模型,用于复杂的文档理解。该模型集成了在大型图像-文本数据上预训练的 CogViT 视觉编码器、具有高效 token 下采样的轻量级跨模态连接器以及 GLM-0.5B 语言解码器。

image.png

用法

文本识别

ollama run glm-ocr Text Recognition: ./image.png

表格识别

ollama run glm-ocr Table Recognition: ./image.png

图表识别

ollama run glm-ocr Figure Recognition: ./image.png

主要特性

  • 最先进的性能:在 OmniDocBench V1.5 上获得 94.62 分,总体排名第一,并在公式识别、表格识别和信息提取等主要文档理解基准测试中提供最先进的结果。

  • 针对实际场景优化:专为实际业务用例设计和优化,在复杂的表格、代码量大的文档、印章和其他具有挑战性的实际布局上保持强大的性能。

  • 高效推理:GLM-OCR 仅有 0.9B 参数,支持通过 vLLM、SGLang 和 Ollama 进行部署,显著降低推理延迟和计算成本,使其非常适合高并发服务和边缘部署。

  • 易于使用:完全开源,并配备了全面的 SDK 和推理工具链,提供简单的安装、单行调用和与现有生产管道的无缝集成。