← 返回 Token雷达 首页

像素级对标?智谱、Kimi 底层参数「撞衫」背后,藏着线性注意力的黄金窗口

来源:雷锋网  ·  发布时间:2026-08-27  ·  热度:0 分

国产大模型内卷到算子底层。 作者丨高允毅 编辑丨岑 峰 昨晚,智谱 AI 认领了最近一周在 OpenRouter 盲测榜上风头最盛的“牛来”模型,正式命名GLM-5.3-Flash。这款上线首日就登顶 OpenRouter 调用量榜单,刷新全网长文本性价比斩杀线的国产模型,在底层架构上展现出“集百家之长”的特质。它采用了混合架构,将 DeepSeek 的稀疏注意力机制(NSA) 与 Kimi 赖以成名的线性注意力机制结合 ,再叠加DeepSeek的流形约束超连接(mHC)技术,可以大幅降本提效。今天早上,月之暗面核心研究员、“注意力残差”论文作者陈广宇,仔细研究了 GLM-5.3-Flash 的模型配置文件后,贴出一张 Kimi K3 和 GLM-5.3-Flash 的底层代码对比图。他发现两者不仅都采用了 KDA 线性注意力,排布逻辑高度重合,连核心参数“遗忘门下界”(gate_lowe

deepseek 大模型 kimi 智谱

阅读原文 →