Kimi 和 DeepSeek 为什么出现在同一张模型架构图里
雷峰网梳理大模型 Attention 路线的变迁,指出 GLM-5.3-Flash 的 45 层架构中 34 层采用 Kimi 路线的 KDA 线性注意力,11 层采用 DeepSeek 路线的 KPool-DSA 稀疏注意力。
雷峰网梳理大模型 Attention 路线的变迁,指出 GLM-5.3-Flash 的 45 层架构中 34 层采用 Kimi 路线的 KDA 线性注意力,11 层采用 DeepSeek 路线的 KPool-DSA 稀疏注意力。