9月18日,智谱旗下BigModel平台正式推出新模型GLM-5.3-FlashX,模型API同步上线。此次更新主要围绕模型推理速度、服务效率以及成本展开,在GLM-5.3-Flash的基础上进一步进行推理基础设施优化,官方定位是面向企业和开发者提供更高吞吐、更低延迟的大模型服务。
公开信息显示,GLM-5.3-FlashX最高输出速度达到约200 tokens/s。智谱方面希望通过此次升级,在模型智能水平、调用速度以及使用成本之间形成更加适合实际应用的组合。
GLM-5.3-FlashX正式上线
从产品定位来看,GLM-5.3-FlashX并不是一次简单的基础模型更换,而是针对大模型实际运行效率进行优化的新版本。
智谱此前于8月14日发布GLM-5.3,在GLM-5.2基础模型架构基础上进一步扩大后训练规模,并重点强化编程、长程任务以及智能体相关能力。智谱官方资料显示,GLM-5.3在内部真实场景编程评测中的端到端完成率较GLM-5.2提升超过50%。
此次推出的FlashX,则进一步把重点放到了推理服务速度和规模化应用上。
对于开发者而言,大模型能力之外,API响应速度、并发能力以及调用成本已经成为影响实际使用的重要因素。特别是在代码生成、智能客服、AI Agent以及企业自动化等需要大量调用模型的场景中,模型输出速度会直接影响用户体验和整体运行成本。
最高输出速度达到200 tokens/s
据公开报道,GLM-5.3-FlashX最高输出速度可达到200 tokens/s,重点面向需要低延迟、高吞吐的大模型应用场景。
与单纯提高模型参数规模相比,提高推理效率需要同时优化模型、硬件、网络以及软件系统。尤其当模型进入真实商业环境之后,面对大量用户同时调用,如何保持稳定的响应速度,对基础设施提出了更高要求。
智谱此次升级也体现出大模型行业竞争重点正在发生变化:模型本身的能力仍然重要,但从实验室走向规模化应用之后,推理效率、算力利用率和单位Token成本同样成为产品竞争的重要组成部分。
背后是超大规模国产芯片算力
此次GLM-5.3-FlashX的推出,与智谱近期在国产算力基础设施方面的探索密切相关。
智谱此前披露,其已经实现10万级国产芯片规模化推理,并围绕模型推理基础设施进行持续优化。9月17日,智谱创始人兼首席科学家唐杰披露,公司正在推进递归自我改进(RSI)相关工程实践。
据公开报道,由GLM-5.3驱动的Infra Agent曾参与GLM-5.3-Flash推理基础设施的设计、调试和优化,在超过10万张国产芯片组成的集群上完成生产级推理服务搭建,并在不到两周时间内将端到端吞吐提升至初始基线的3倍。
这意味着,智谱当前关注的不仅是训练出更强的模型,也在尝试让AI参与模型自身运行环境的优化。
从“模型升级”转向“系统效率提升”
近年来,大模型产品迭代速度明显加快。智谱今年已经陆续推出GLM-5、GLM-5.1、GLM-5.2和GLM-5.3等版本,其模型能力提升并不完全依赖增加参数规模,而是越来越重视后训练、强化学习、长程任务环境以及推理基础设施等环节。
智谱在此前业绩沟通中透露,GLM-5.3与GLM-5.2采用相同的基座模型,主要通过扩大长程任务环境和强化学习训练量来提升模型能力。
这种技术路线也说明,大模型的竞争正在从单纯的“参数规模竞争”,逐渐延伸到训练数据、强化学习、任务环境、推理系统和算力利用率等多个环节。
对于企业用户来说,真正决定AI产品使用效果的,也不仅仅是模型在某一项公开测试中的成绩,而是模型能否稳定处理真实业务、能否快速响应以及能否控制长期使用成本。
智谱正在加速下一代模型研发
就在新模型发布前,智谱已经宣布完成大规模融资。
9月13日,智谱发布公告称完成约50亿美元融资,包括股份配售和可转换债券发行。公司表示,募集资金将主要用于下一代GLM基础模型、完全自训练体系以及相关算力基础设施建设。
此前智谱已经透露,下一代基础模型正在推进,未来方向包括更大的有效规模、更长的原生上下文以及原生多模态统一建模。智谱创始人唐杰还曾将GLM-6.0的一个重要研究方向概括为“自进化”。
从GLM-5.3到此次GLM-5.3-FlashX,再到下一代基础模型研发,智谱正在形成从模型训练、后训练到推理基础设施的完整技术路线。
大模型进入规模化应用竞争阶段
此次GLM-5.3-FlashX上线的时间点也值得关注。当前国内外大模型厂商都在加快模型更新速度,模型调用量、API价格、推理速度以及开发者生态成为市场竞争的重要指标。

数据显示,9月7日至13日,全球AI大模型总调用量达到127万亿Token,其中中国大模型周调用量约61.17万亿Token,连续20周超过美国同期水平。
在这样的市场环境下,模型厂商需要解决的不只是“能不能做出更聪明的模型”,还包括“能不能让更多用户用得起、用得快、用得稳定”。
从这个角度看,GLM-5.3-FlashX此次将推理速度和基础设施效率作为重点,反映出大模型行业正在从模型能力竞争进一步走向规模化应用竞争。
对于开发者和企业用户而言,新模型能否在真实业务中持续保持较高速度、稳定性和成本效率,还需要随着实际调用进一步观察。但可以确定的是,随着模型迭代周期不断缩短,AI行业的竞争已经从单一模型能力,扩展到模型、算力、基础设施和商业化服务的综合竞争。

微信扫一扫打赏
支付宝扫一扫打赏