Z.AI MODEL SELECTION GUIDE · 2026
EN

Z.ai 模型选择指南

智谱 Z.ai 全系列模型解析 · 文本生成 · 多模态理解 · 图像/视频/语音 · 向量检索 — 数据来源:BigModel 模型概览 · 产品价格(2026-08-30 同步)

69+收录模型
8模型分类
1M最大上下文
定位
旗舰均衡经济
响应速度
极速快速标准较慢很慢
模态能力
文本图像音频视频代码
推理强度
最强深度标准基础快速
价格档位
天价¥20+ / ¥72+昂贵¥8-20 / ¥36-72较贵¥2-8 / ¥8-36适中¥0.5-2 / ¥2-8实惠¥0.1-0.5 / ¥0.4-2白菜价<¥0.1 / <¥0.4单位:元 CNY / 1M tokens(输入 / 输出),按官方原价

快速选型

按任务类型直达推荐模型

日常对话 / 写作GLM-5.3
复杂推理 / 长程 AgentGLM-5.3
专业编程 / 软件工程GLM-5.3
图像 / 视频理解GLM-5.3-Flash
极致省钱GLM-4.7-Flash
超长文档处理GLM-4-Long
图像生成GLM-Image
视频生成CogVideoX-3
实时语音对话GLM-Realtime-Flash
语音识别GLM-ASR-2512
语音合成GLM-TTS
语义搜索 / RAGEmbedding-3

命名规律速查

掌握这些规律,看到任何模型名都能秒懂其定位

命名元素含义示例
GLM 前缀 智谱通用语言模型系列 GLM-5.3, GLM-4.7
版本号 (4→5→5.3) 数字越大,模型越新越强 GLM-4 → GLM-5 → GLM-5.3
-Flash 轻量快速,普惠省钱 GLM-5.3-Flash, GLM-4.7-Flash
-FlashX Flash 增强高速版 GLM-4.7-FlashX
-Turbo 速度优化版 GLM-5-Turbo, GLM-5V-Turbo
-Air 轻量均衡版 GLM-4.5-Air
-AirX 极速低延迟版 GLM-4.5-AirX
-Long 超长上下文专用 GLM-4-Long
-V 视觉理解模型 GLM-5V-Turbo, GLM-4.6V
-V-Thinking 视觉推理模型 GLM-4.1V-Thinking-FlashX
GLM-Realtime 实时音视频对话 GLM-Realtime
GLM-ASR 自动语音识别 GLM-ASR-2512
GLM-TTS 文本转语音 GLM-TTS
CogView 图像生成 CogView-4
CogVideoX 视频生成 CogVideoX-3
Vidu 视频生成(合作) Vidu Q1
Embedding 文本向量化 Embedding-3
-YYYYMMDD 日期快照 GLM-4-Flash-250414

前沿旗舰模型

智谱最新一代旗舰模型,推荐用于复杂推理、编程、Agent 与多模态任务

模型 ID定位价格模态推理速度上下文输入输出说明
GLM-5.3NEW 旗舰
最强 标准 1M 1M 128K 最新旗舰,面向复杂软件工程与长程 Agent 任务,编程体验较前代提升 50%
GLM-5.3-FlashNEW 均衡
深度 快速 1M 1M 128K 原生多模态普惠模型,原生理解图片/视频/文件;原价 ¥0.8/¥2.8,限时 5 折(¥0.4/¥1.4)
GLM-5.2 旗舰
最强 标准 1M 1M 128K 支撑复杂长程任务稳定执行,Coding 能力大幅提升
GLM-5.1 旗舰
深度 标准 200K 200K 128K Coding 能力对齐 Claude Opus 4.6,长程任务可自主工作长达 8 小时;输入 ≥32K 时 ¥8/¥28
GLM-5 旗舰
深度 标准 200K 200K 128K 编程能力对齐 Claude Opus 4.5,擅长 Agentic 长程规划与执行;输入 ≥32K 时 ¥6/¥22
GLM-5V-Turbo 旗舰
深度 快速 200K 200K 128K 多模态 Coding 基座,兼顾视觉理解、推理与代码生成;输入 ≥32K 时 ¥7/¥26
GLM-5-Turbo 均衡
深度 快速 200K 200K 128K 长任务核心需求专项优化,复杂长任务执行连续性好;输入 ≥32K 时 ¥7/¥26

文本模型

专注于自然语言理解与生成的文本模型,覆盖对话、写作、推理与代码场景

模型 ID定位价格模态推理速度上下文输入输出说明
GLM-4.7 均衡
标准 标准 200K 200K 128K 通用对话、推理与智能体能力升级;输入 <32K 且输出 <0.2K 时 ¥2/¥8
GLM-4.7-FlashX 经济
基础 极速 200K 200K 128K 轻量高速 Flash 增强版,推理速度快,适合高并发调用;输入 ¥0.5/输出 ¥3
GLM-4.7-Flash 经济
基础 极速 200K 200K 128K 免费文本模型,延续 GLM-4.7 基座的通用能力
GLM-4.6 均衡
标准 标准 200K 200K 128K 擅长高级编码、复杂推理与工具调用;按量计费价格未公开,可通过私有实例部署
GLM-4.5-Air 均衡
标准 标准 128K 128K 96K 轻量模型,推理、编码与智能体任务表现稳定
GLM-4.5-AirX 经济
基础 快速 128K 128K 96K 极速版本,适合低延迟、高响应要求的业务场景
GLM-4-Long 均衡
标准 标准 1M 1M 4K 专为超长文本和记忆型任务设计
GLM-4-FlashX-250414 经济
基础 极速 128K 128K 16K Flash 增强高速版本,适合高并发调用场景
GLM-4.5-Flash 经济
基础 极速 128K 128K 96K 免费文本模型,支持最长 128K 上下文处理
GLM-4-Flash-250414 经济
基础 极速 128K 128K 16K 免费文本模型
GLM-4-Plus 旗舰
深度 标准 128K 128K 128K 高智能旗舰,全自研第四代基座大模型,支持高级 Agent 能力
GLM-4-Air-250414 均衡
标准 标准 128K 128K 128K GLM-4-Air 日期快照 250414,高性价比文本模型
GLM-4-AirX 均衡
标准 快速 8K 8K 8K 极速推理版本,适合低延迟高响应场景
GLM-4-Assistant 均衡
标准 标准 128K 128K 128K 面向智能体应用优化的文本模型
GLM-Z1-Air 均衡
深度 标准 128K 128K 128K 高性价比推理模型
GLM-Z1-AirX 均衡
深度 快速 32K 32K 32K 极速推理模型,兼顾推理深度与响应速度
GLM-Z1-FlashX 经济
标准 极速 128K 128K 16K 高速低价推理模型,适合高并发推理场景
GLM-Z1-Flash 经济
标准 极速 128K 128K 16K 免费推理模型
GLM-4-9B 均衡
基础 标准 128K 128K 128K 开源 9B 文本模型
ChatGLM3-6B 均衡
基础 标准 8K 8K 8K 开源对话模型(第三代)

视觉理解模型

图像与视频理解、视觉推理及移动端智能体模型

模型 ID定位价格模态推理速度上下文输入输出说明
GLM-4.6V 均衡
标准 标准 128K 128K 32K 原生支持工具调用,前端代码复刻效果更稳定;输入 <32K 时 ¥1/¥3,[32,128) 时 ¥2/¥6
GLM-4.5V 均衡
标准 标准 64K 64K 32K 视觉理解模型;输入 <32K 时 ¥2/¥6
GLM-4V-Plus-0111 均衡
标准 标准 16K 16K 视觉推理模型,¥4/1M tokens
AutoGLM-Phone 旗舰
标准 标准 20K 20K 2048 手机智能助理框架,支持自然语言完成 App 操作任务
GLM-4.1V-Thinking-FlashX 均衡
深度 快速 64K 64K 16K 擅长复杂场景理解与多步骤分析,适合高并发视觉推理场景
GLM-OCR 均衡 ¥0.2 / 1M tokens
基础 快速 32K 32K 轻量图文解析模型,兼顾高精度、高效率文档理解;输入:单图 ≤10MB / PDF ≤50MB / 100页
GLM-4.6V-FlashX 经济
基础 极速 128K 128K 32K 高速视觉推理模型;输入 <32K 时 ¥0.15/¥1.5,[32,128) 时 ¥0.3/¥3
GLM-4.6V-Flash 经济
基础 极速 128K 128K 32K 免费模型,支持视觉推理
GLM-4.1V-Thinking-Flash 经济
标准 极速 64K 64K 16K 免费模型,支持视觉推理
GLM-4V-Flash 经济
快速 极速 16K 16K 1K 免费模型,支持图像理解

图像生成模型

文生图与图像编辑模型,按请求次数计费

模型 ID定位价格模态说明
GLM-Image 旗舰 ¥0.1 / 次
旗舰图像生成模型,复杂指令遵循与知识密集生成更强,文字渲染表现突出,支持多分辨率
CogView-4 均衡 ¥0.06 / 次
通用图像生成模型,生成质量高,画面细节更完整,适合多类创意场景,支持多分辨率
CogView-3-Flash 经济 免费
免费模型,适合轻量图像创作,支持多分辨率

视频生成模型

文生视频、图生视频与首尾帧生成模型,按请求次数计费

模型 ID定位价格模态说明
CogVideoX-3 旗舰 ¥1 / 次
旗舰视频模型,指令遵循与物理模拟更强,现实与 3D 场景表现提升,支持首尾帧生成
ViduQ1-Text 均衡 ¥2.5 / 次
Vidu Q1 文生视频,1080p
ViduQ1-Image 均衡 ¥2.5 / 次
Vidu Q1 图生视频,1080p
ViduQ1-Start-End 均衡 ¥2.5 / 次
Vidu Q1 首尾帧生成,1080p
Vidu2-Image 均衡 ¥1.25 / 次
Vidu 2 图生视频,720p
Vidu2-Start-End 均衡 ¥1.25 / 次
Vidu 2 首尾帧生成,720p
Vidu2-Reference 均衡 ¥2.5 / 次
Vidu 2 参考生视频,720p
CogVideoX-2 均衡 ¥0.5 / 次
通用视频生成模型,支持多分辨率
CogVideoX-Flash 经济 免费
免费视频生成模型,支持图像、文本输入

音视频模型

语音识别、语音合成、实时语音/视频对话与音色克隆模型,计费单位各异

模型 ID定位价格模态说明
GLM-Realtime-Flash 旗舰 音频 ¥0.18/分钟 · 视频 ¥1.2/分钟
实时音视频模型,低延迟版本,支持视频、音频、文本多模态输入
GLM-Realtime-Air 均衡 音频 ¥0.3/分钟 · 视频 ¥2.1/分钟
实时音视频模型,轻量均衡版本,支持视频、音频、文本多模态输入
GLM-4-Voice 均衡 ¥80 / 1M tokens
实时语音对话模型,支持文本、音频;音频 token 单价,不可与文本档直接比较
GLM-TTS-Clone 均衡 ¥6 / 次
音色克隆模型,3 秒音频即可快速生成相似音色
GLM-TTS 均衡 ¥2 / 万字符
语音合成模型,支持超拟人语音生成与情感表达,提供非流式与流式接口
GLM-ASR-2512 均衡 输入 ¥16/1M tokens(约 ¥0.0002/秒),输出免费
高精度语音识别模型,字符错误率低,支持自定义词汇,覆盖多种主流语言与方言场景

向量模型与其他

向量检索、重排序、角色扮演、心理陪伴与代码补全等专用模型

模型 ID定位价格模态上下文输出说明
Embedding-3 均衡
8K 第三代文本向量化模型(V3),适用于语义检索、聚类、主题建模与分类等场景
Embedding-2 均衡
8K 第二代文本向量化模型(V2)
Rerank 均衡
4K 文本重排序模型,输入 ¥0.8/百万 tokens
CodeGeeX-4 均衡
128K 32K 代码补全模型
CharGLM-4 均衡
8K 4K 拟人对话模型
Emohaa 均衡
8K 4K 心理情感支持模型

历史模型

已停止推荐或进入维护期的旧版模型,仅作兼容参考

模型 ID定位价格模态推理速度上下文输入输出说明
GLM-4-0520 均衡
标准 标准 128K 128K 128K GLM-4 0520 历史版本
GLM-4V-Plus 均衡
标准 标准 8K 8K 8K GLM-4V Plus 历史版本
GLM-4V 均衡
标准 标准 8K 8K 8K GLM-4V 历史版本
GLM-4 均衡
标准 标准 128K 128K 128K GLM-4 基础历史版本
GLM-4-Air 均衡
标准 标准 128K 128K 128K GLM-4-Air 历史版本
GLM-4-Flash 经济
基础 极速 128K 128K 16K GLM-4-Flash 历史版本,免费
GLM-4.5 均衡
标准 标准 128K 128K 128K 按量 API 已下架,仅提供微调与私有化部署
CogView-3 均衡
基础 标准 按量 API 已下架,仅支持私有化部署;历史按量 ¥0.06/次

场景能力矩阵

按典型场景快速找到首选与备选模型

场景推荐模型备选模型关键能力
复杂编程 / 软件工程 GLM-5.3 GLM-5.2 推理 长上下文 Agent
深度推理 / 数学推导 GLM-5.3 GLM-5.1 最强推理 128K 输出
超长文档处理 GLM-4-Long GLM-5.3 1M 上下文 低成本
图像 / 视频理解 GLM-5.3-Flash GLM-4.6V 原生多模态 视频理解
图像生成 GLM-Image CogView-4 文字渲染 多分辨率
视频生成 CogVideoX-3 ViduQ1-Text 首尾帧 物理模拟
实时语音对话 GLM-Realtime-Flash GLM-4-Voice 实时 音视频
语音识别 GLM-ASR-2512 高精度 方言
语义搜索 / RAG Embedding-3 Embedding-2 8K 上下文 语义检索
极致省钱 GLM-4.7-Flash GLM-4-Flash-250414 免费 200K 上下文