Kimi 和 DeepSeek 为什么出现在同一张模型架构图里
雷峰网梳理大模型 Attention 路线的变迁,指出 GLM-5.3-Flash 的 45 层架构中 34 层采用 Kimi 路线的 KDA 线性注意力,11 层采用 DeepSeek 路线的 KPool-DSA 稀疏注意力。
雷峰网梳理大模型 Attention 路线的变迁,指出 GLM-5.3-Flash 的 45 层架构中 34 层采用 Kimi 路线的 KDA 线性注意力,11 层采用 DeepSeek 路线的 KPool-DSA 稀疏注意力。
芯片设计瓶颈已从逻辑综合与布局布线转移到功能验证,验证如今占芯片开发工作量的 60–70%。定制 ASIC 的工程投入估计超过 1000 个工程月,且从设计到流片至少需要两年。LLM 被视为缓解这一人力密集环节的关键技术。
西门子 EDA 技术与战略顾问 Dr. Jim Shiely 提出 Manufacturing Intelligence,主张将物理理解与制造观测系统性转化为可信的制造干预,而非停留在生成更多仿真与量测数据。
MIT Technology Review 的 James O'Donnell 讨论 AI 公司宣称科学发现引发的争议。
GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。UC Berkeley 的 Aditya G. Parameswaran 等人提出,近乎免费的推理成本带来三类数据系统挑战:面向智能体的数据系统、由智能体运行的数据系统,以及由智能体构建的数据系统。