245.1K 下载 更新 2个月前
ollama run glm-ocr
ollama launch claude --model glm-ocr
ollama launch codex --model glm-ocr
ollama launch opencode --model glm-ocr
ollama launch openclaw --model glm-ocrGLM-OCR 是一种基于 GLM-V 编码器-解码器架构的多模态 OCR 模型,用于复杂的文档理解。该模型集成了在大型图像-文本数据上预训练的 CogViT 视觉编码器、具有高效 token 下采样的轻量级跨模态连接器以及 GLM-0.5B 语言解码器。
ollama run glm-ocr Text Recognition: ./image.png
ollama run glm-ocr Table Recognition: ./image.png
ollama run glm-ocr Figure Recognition: ./image.png
最先进的性能:在 OmniDocBench V1.5 上获得 94.62 分,总体排名第一,并在公式识别、表格识别和信息提取等主要文档理解基准测试中提供最先进的结果。
针对实际场景优化:专为实际业务用例设计和优化,在复杂的表格、代码量大的文档、印章和其他具有挑战性的实际布局上保持强大的性能。
高效推理:GLM-OCR 仅有 0.9B 参数,支持通过 vLLM、SGLang 和 Ollama 进行部署,显著降低推理延迟和计算成本,使其非常适合高并发服务和边缘部署。
易于使用:完全开源,并配备了全面的 SDK 和推理工具链,提供简单的安装、单行调用和与现有生产管道的无缝集成。