智谱开源多模态大模型 GLM-4.6V 系列

admin 百科 2025-12-13 22

智谱ai正式推出glm-4.6v系列开源多模态大模型，涵盖旗舰级glm-4.6v（106b-a12b）与轻量免费版glm-4.6v-flash（9b）。该系列首创“图像即参数，结果即上下文”的原生多模态工具调用机制，支持高达128k的视觉上下文长度，可一次性解析约150页pdf文档或长达1小时的视频内容。

智谱开源多模态大模型 GLM-4.6V 系列-第1张图片-佛山资讯网

GLM-4.6V（106B-A12B）：专为云端服务及高性能计算集群优化的基础版本；
GLM-4.6V-Flash（9B）：面向终端设备、边缘部署及低延迟交互场景设计的精简版本。

作为GLM家族在多模态方向的关键升级，GLM-4.6V将训练阶段支持的最大上下文扩展至128K tokens，在视觉理解准确率方面刷新同参数量级SOTA纪录，并首次在模型底层架构中深度集成 Function Call（函数/工具调用）能力，实现从「视觉输入感知」到「可执行操作指令」的端到端闭环，为构建真正可用的多模态智能体（Multimodal Agent）提供统一、高效的技术支撑。

在涵盖图文问答、视觉推理、跨模态检索等在内的30余项权威多模态基准测试中，GLM-4.6V全面领跑同规模竞品；其API调用成本相较前代下降50%。典型落地场景包括：AI图文协同创作、视觉驱动的智能导购助手、网页截图→前端代码一键生成、以及长时序视频内容结构化分析。全部模型权重与配套代码已同步上线GitHub、Hugging Face及魔搭（ModelScope）平台。

智谱开源多模态大模型 GLM-4.6V 系列-第2张图片-佛山资讯网