Skip to main content

最新模型

GLM-5.3

旗舰模型
  • 在复杂软件工程、终端操作和更广泛的 Agent 任务上进步显著,并在效果和 Token 利用率之间平衡更佳

GLM-5.3-Flash

原生多模态模型
  • 普惠的全球前沿模型,能够原生理解图片视频、生成可交互代码,自主完成研究分析、文档制作等专业任务

推荐模型

若需要看模型价格,请直接前往价格页面
以下为智谱 9 款核心模型,覆盖文本生成、多模态理解、图像生成、视频生成、OCR、语音识别、语音合成、向量检索等全场景需求:

文本模型

文本模型是一类专注于处理和生成自然语言的模型,涵盖了语言理解与推理能力,能够自动处理海量文本数据并进行逻辑推导。智谱的文本模型结合了强大的语言模型和推理模型,使得系统不仅能理解和生成文本内容,还能进行高层次的推理和判断。

视觉理解模型

视觉理解模型侧重于看懂图像内容,如识别物体、场景和关系;而视觉推理模型进一步具备看图思考的能力,能结合视觉与语言信息完成逻辑判断、因果分析和多步推理,常用于图文问答、图像描述生成、多模态对齐等复杂任务。

图像生成模型

图像生成模型是一类通过学习海量图像数据,实现从文本生成高质量图片的模型,广泛应用于视觉内容创作、游戏美术、产品设计、医学影像合成等领域。

视频生成模型

视频生成模型是一类通过学习时序视觉数据,从文本、图像或其他视频素材生成动态视频内容的模型,广泛应用于影视制作、虚拟人、动画生成、数字营销等领域。

音视频模型

音视频模型是一类处理音频与视频信号的多模态模型,能够理解、生成或编辑视听内容,广泛应用于虚拟人、语音驱动动画、视频配音与剪辑、跨模态检索等场景。

向量模型与其他