观点网讯:8月27日,摩尔线程官宣基于MTT S5000智算卡及MUSA软件栈,完成对智谱多模态模型GLM-5.3-Flash的Day-0适配。该模型参数规模为320B-A18B,由智谱上线并开源。
针对GLM-5.3-Flash线性注意力采用的KDA机制,摩尔线程研发团队基于MATE算子优化引擎完成定制算子调优,并与SGLang-MUSA缓存体系打通。此举将传统KV Cache转化为状态矩阵的增量更新,大幅缓解了长上下文推理的显存压力,实现该模型在国产算力平台的高效运行。
此前,GLM-5.3-Flash以代号Ox-Alpha(社区昵称“牛来”)在OpenCode和OpenRouter进行匿名公测,凭借推理速度与智能表现,创下双平台调用量新高。
免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。