Skip to main content
本文介绍如何将调用从 GLM-4.5 GLM-4.6 GLM-4.7 GLM-5.1 或其它早期模型迁移到我们迄今为止最强的编码模型 GLM-5.2,涵盖采样参数差异、流式工具调用等要点。

GLM-5.2 的特性

  • 支持更大上下文与输出:最大上下文 1M,最大输出 128K。
  • 新增支持工具调用过程的流式输出(tool_stream=true),实时获取工具调用参数。
  • 同 GLM-4.7 系列支持深度思考(thinking={ type: "enabled" })。开启后,GLM-5.2 为模型自动判断是否思考,GLM-4.7 为强制思考。
  • 新增 reasoning_effort 参数用于控制模型在开启“思维链”下的推理程度。
  • 更卓越的代码性能和先进的推理能力。

迁移清单(Checklist)

  • 更新模型编码为 glm-5.2
  • 采样参数:temperature 默认值 1.0, top_p 默认值 0.95,建议只选一个进行调参
  • 深度思考:按需关闭或启用 thinking={ type: "enabled" },用于复杂推理/编码
  • 控制推理程度: 配置 reasoning_effort 来决定 high - 增强推理 还是 max - 深度推理(默认值)
  • 流式响应:启用 stream=true 并正确处理 delta.reasoning_contentdelta.content
  • 流式工具调用:启用 stream=truetool_stream=true 并流式拼接 delta.tool_calls[*].function.arguments
  • 最大输出与上下文:合理设置 max_tokens(GLM-5.2 最大输出 128K,上下文 1M)
  • Prompt 优化:配合深度思考,采用更明确的指令与约束
  • 开发环境验证:进行用例测试与回归,关注随机性、延迟、工具流中的参数完整性

开始迁移

1. 更新模型编码

  • model 更新为 glm-5.2

2. 更新采样参数

  • temperature:控制随机性;数值更高更发散,数值更低更稳定。
  • top_p:控制核采样;更高值扩大候选集,更低值收敛候选集。
  • temperature 默认为 1.0, top_p 默认为 0.95, 不建议同时调整两者。

3. 深度思考(可选)

  • GLM-5.2 延续支持深度思考能力,默认为开启。
  • 在复杂推理、编码任务中,建议开启:
  • 控制推理程度,默认 max 深度推理:

4. 流式输出与流式工具调用(可选)

  • GLM-5.2 支持工具调用过程的实时流式构建与输出,默认 False 关闭,需同时打开:
    • stream=True:开启响应的流式输出
    • tool_stream=True:开启工具调用参数的流式输出
详见:工具流式输出文档

5. 测试与回归

在开发环境中先行验证迁移后的调用是否稳定,关注:
  • 响应是否符合预期、是否出现过度随机或过度保守的输出
  • 工具流式构建与输出是否正常
  • 长上下文与深度思考场景下的延迟与成本

更多资源

核心参数

模型常见参数概念与采样建议

工具流式输出

查看工具流式输出使用详情

API 参考

查看完整的 API 文档

技术支持

获取技术支持和帮助