跳到正文
今天10月1日周四
8月12日周三
  1. Google DeepMind74

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布多语种手语转文本模型 SL2T,在 Pixel 11 的 Gboard 和 Live Transcribe 中提供手语听写功能,首发支持美国手语(ASL)转英文,后续将扩展更多设备与语言。

    推荐理由:SL2T 把多语种手语翻译模型落到 Gboard 与 Live Transcribe,读者可了解其数据规模、隐私设计与基准表现。

8月10日周一
7月8日周三
  1. Mistral AI69

    Mistral 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布首款具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、不依赖 LiDAR 或深度传感器,在 R2R-CE validation unseen 上取得 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。

    推荐理由:Mistral 首款具身导航模型只用单目 RGB 相机就在 R2R-CE 上超过多传感器方案,可看其训练与强化学习设计。

6月27日周六
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B 无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的本地多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型表现,内存占用不到其一半,可在 16GB 显存或统一内存的消费级笔记本上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体部署的门槛变化。

2月5日周四
  1. Mistral AI71

    Mistral 发布 Voxtral Transcribe 2 语音转写模型家族

    Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,支持说话人分离、上下文偏置和词级时间戳,覆盖 13 种语言。

    推荐理由:Mistral 一次发布批量与实时两款语音转写模型,并给出延迟、错误率与价格对比,便于判断实时语音场景的可用性。

12月3日周三
3月17日周一
  1. Mistral AI71

    Mistral 发布 Mistral Small 3.1,支持多模态与 128k 上下文

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,并以 Apache 2.0 许可开源。

    推荐理由:Mistral Small 3.1 以 Apache 2.0 开源并支持 128k 上下文与多模态,读者可据此判断小模型在端侧与智能体场景的可用边界。