智谱上线 GLM-5.3-FlashX:推理速度最高达 200 tokens/s
智谱正式推出 GLM-5.3-FlashX 模型并开放 API 接口。该模型此前以“Ox Alpha”代号测试,在10万张国产芯片构建的推理算力基础设施上,通过底层架构与推理优化,实现了最高 200 tokens/s 的生成速度。智谱表示,GLM-5.3-FlashX 旨在兼顾智能水平、性价比与推理速度,全面提升企业及开发者的调用体验。
智谱正式推出 GLM-5.3-FlashX 模型并开放 API 接口。该模型此前以“Ox Alpha”代号测试,在10万张国产芯片构建的推理算力基础设施上,通过底层架构与推理优化,实现了最高 200 tokens/s 的生成速度。智谱表示,GLM-5.3-FlashX 旨在兼顾智能水平、性价比与推理速度,全面提升企业及开发者的调用体验。