updream-视频生成助手
当前位置:首页>AI资讯>智谱上线 GLM-5.3-FlashX:最高 200 tokens/s,进一步提升推理速度

智谱上线 GLM-5.3-FlashX:最高 200 tokens/s,进一步提升推理速度

GLM-5.3-FlashX

2026年09月18日,智谱正式推出 GLM-5.3-FlashX,将 GLM-5.3-Flash 的在线推理速度进一步提升,最高输出速度可达 200 tokens/s。新版本 API 已同步上线,Model Key 为 GLM-5.3-FlashX,企业和开发者可以通过智谱开放平台调用。

GLM-5.3-Flash 此前曾以匿名模型 Ox Alpha 与开发者见面。随着模型调用量增长,智谱表示,其在 10 万张国产芯片提供的推理算力基础上,进一步增加 Infra 侧投入并进行推理优化,由此推出此次面向高速推理场景的 FlashX 版本。

与重新发布一款全新基座模型不同,GLM-5.3-FlashX 此次升级的重点主要是“提速”。其基础模型 GLM-5.3-Flash 于今年 8 月发布并开源,采用 320B 总参数、18B 激活参数的 MoE 架构,是 GLM-5 系列首个原生多模态模型,重点覆盖 Coding、Agent、视觉编程以及专业文档处理等任务。

对于 AI Coding 和 Agent 应用而言,模型输出速度会直接影响实际使用体验。代码生成、工具调用以及多步骤 Agent 工作流往往需要频繁请求模型,更高的 Token 输出速度可以缩短单次等待时间,让连续任务执行更加流畅。因此,FlashX 更适合对低延迟、实时交互和高频调用有较高要求的应用场景。

GLM-5.3-Flash 本身也针对推理效率进行了架构优化。智谱官方介绍显示,其采用线性注意力与稀疏注意力结合的混合架构,并通过降低激活参数量和模型层数减少计算成本;模型还具备原生视觉能力,可在前端开发、游戏开发、3D 场景以及 Office 文档任务中利用视觉反馈检查和改进输出。

目前 GLM-5.3-FlashX API 已正式上线,开发者可通过智谱对话补全接口调用,也可以在官方体验中心直接测试。此次 FlashX 的推出,使 GLM-5.3-Flash 在原有智能水平和性价比之外,进一步强化了推理速度这一维度。

©版权声明:如无特殊说明,本站所有内容均为AIHub.cn原创发布和所有。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。否则,我站将依法保留追究相关法律责任的权利。 即梦AI