像素级对标?智谱、Kimi 底层参数「撞衫」背后,藏着线性注意力的黄金窗口
国产大模型内卷到算子底层。 作者丨高允毅 编辑丨岑 峰 昨晚,智谱 AI 认领了最近一周在 OpenRouter 盲测榜上风头最盛的“牛来”模型,正式命名GLM-5.3-Flash。这款上线首日就登顶 OpenRouter 调用量榜单,刷新全网长文本性价比斩杀线的国产模型,在底层架构上展现出“集百家之长”的特质。它采用了混合架构,将 DeepSeek 的稀疏注意力机制(NSA) 与 Kimi 赖以成名的线性注意力机制结合 ,再叠加DeepSeek的流形约束超连接(mHC)技术,可以大幅降本提效。今天早上,月之暗面核心研究员、“注意力残差”论文作者陈广宇,仔细研究了 GLM-5.3-Flash 的模型配置文件后,贴出一张 Kimi K3 和 GLM-5.3-Flash 的底层代码对比图。他发现两者不仅都采用了 KDA 线性注意力,排布逻辑高度重合,连核心参数“遗忘门下界”(gate_lowe
deepseek 大模型 kimi 智谱