智谱 8 月 14 日悄悄把 GLM-5.3 推上 GLM Coding Plan,这一版最大的变化不是分数,而是把思考强度从“开/关”两档拆成了 low、high、max 三档。调对档位,5.3 能在“几秒钟吐个答案”和“烧 30 秒想半天”之间自由切换。

工具简介

GLM-5.3 是智谱 2026 年 8 月 14 日发布的旗舰模型,基座和 GLM-5.2 一致,所有提升都来自后训练。1M token 上下文、最大输出 128K token,Artificial Analysis 智能指数 60 分,跟 Kimi K3 并列开源第一,仅次于 GPT-5.6 Sol 一分。已经全量上 GLM Coding Plan,API 还在排队。

核心功能亮点

  1. 思考三档可调:low、high、max,迁移提示要把旧的 thinking.type=disabled 改成 enabled,否则请求会失败。
  2. 编程体感比 5.2 强 50%,在 Terminal-Bench 3.0 上从 4.6 跳到 28.3,DeepSWE v1.1 从 46.2 升到 66.9。
  3. 网络安全能力涌现,CyberGym 84.5% 拿到当前最佳,ExploitBench 54.4% 比 5.2 翻倍还多,真实代码库中已经发现 2436 个漏洞,最老的一个在代码里躺了 40 年。

实测使用步骤

第一步,去 z.ai 注册账号,选 GLM Coding Plan 个人版,目前是积分制,周末全天半价,5.3 的 max 档一次任务大约消耗 5-8 倍标准积分。第二步,打开 ZCode 或 Claude Code,把 base URL 切到 https://open.bigmodel.cn/api/paas/v4,模型名写 glm-5.3thinking.typeenabledreasoning_effort 选 low 起步。第三步,跑一个真实任务:把一段 200 行的 Python 重构请求发出去,先 low,看返回;不满意就 high,再不满意直接 max。第四步,在 Z.ai dashboard 查积分消耗,对比三档的输出 token 数。

适用人群与场景

日常写代码、写文档的开发者选 low 档,响应快、积分便宜;做长程 Agent 任务、多文件重构、终端操作的工程师用 high 档,这是官方推荐的甜点档;做科研、漏洞研究、复杂策略推演的研究员上 max,准确率最高但积分烧得也最快。不建议普通用户日常 max 起步,容易把周配额烧光。

优缺点总结

优点:三档切换比 Claude 的 thinking_budget 简单很多,不用学预算概念,直接选档位;低档保留思考能力但 token 消耗小,比“开/关”模型更省;ZCode、Claude Code、Cline、OpenCode 都接好了,工具链不挑食。缺点:5.3 目前只支持文本,图像和视频还得等;max 档单任务平均输出约 7.5 万 token,新手容易超额;API 还没完全开放,只能走 GLM Coding Plan 积分制。

早悟点评

把“思考”做成显式档位,是智谱给国产模型立的一个好习惯。Sonnet 用户纠结 thinking_budget 设多少、要不要 auto,5.3 用户只看任务难度,low 跑不通就 max,简单到不用动脑。短期看是产品体验的小改进,长期看是模型定价模型的变化:厂商把“思考”从默认行为里拆出来,变成可计费的可选项,用户在 token 单价之外多了一条“思考预算”的成本线。

行业观察

2026 年下半年,国产旗舰大概率都会跟进“思考档位”这个范式:豆包已经分“快速/专家/办公 Turbo/办公 Pro”四档,千问 App 上线“思考研究”,Kimi 一直有“专家模式”。当大家都接受“思考 = 可调档位”之后,真正的差异化会回到三件事:档位之间的颗粒度、定价透明度,以及工具链兼容度。GLM-5.3 现在三档分得比较粗,low 跟 high 的差距,可能没 high 跟 max 那么大,这反而是它下一步该优化的方向。

智谱 GLM-5.3 思考三档 封面

发表评论