跳到正文
今天10月1日周四
  1. MacRumors38

    苹果智能家居中枢曝光:iMac G4 风格设计,配 6 英寸方形屏

    苹果长期传闻的智能家居中枢将采用 iMac G4 风格设计,配备 6 英寸方形屏幕,有台面放置和壁挂两个版本,壁挂版代号 J491。设备无电池需持续供电,通过 USB-C 供电,无音量键和电源键,正面配一枚 FaceTime 摄像头,支持语音与面部识别,识别失败时可用 iPhone 二次验证。该设备据称将于 10 月 13 日与新 HomePod mini 和 Apple TV 一同推出。

  2. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步向开发者、企业和消费者推出。

    推荐理由:Gemini 4 Argon 公布输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的能力边界。

  3. 9to5Google88

    Google 发布新前沿模型 Gemini 4 Argon

    Google 发布新前沿模型 Gemini 4 Argon,面向复杂长程工作流的深度推理,输出 token 上限从 64K 提升到 1M,并扩展了编码、推理和多模态能力。

    推荐理由:Google 新前沿模型把输出上限提到 1M token,并给出编码、安全与内部落地数据,可据此判断长程推理的实用边界。

9月30日周三
  1. 雷峰网34

    百度库库AI如何用文库网盘打上下文之战?

    百度将文库、网盘十余年积累的内容资产作为AI办公的上下文来源,GenFlow 1.0 已于去年4月以通用AI Agent形态切入写论文、做PPT等场景,今年8月官宣中文名“库库AI”并上线独立端。库库AI已开放连接器授权,可调用飞书、钉钉内容,企业版推出后已有3000家企业试用;海外版由Oreate AI焕新为Kooko,一年内海外用户突破1000万。

  2. Apple Newsroom22

    Apple Creator Studio 将迎来新更新

    Apple Creator Studio 将推出全新模板、端到端电影级视频功能与多项提效特性。Freeform 新增自动适配深色模式、文件夹整理看板,并支持 Apple Intelligence 写作工具改写、校对和摘要手写笔记。visionOS 27 中 Freeform 可将图片、视频、便签、形状和 3D 模型拖入空间并成组查看。

9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与科研人员的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

9月27日周日
9月25日周五
  1. Google Research62

    Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director 多智能体框架,在 Gemini 和 Veo 之上规划多镜头叙事的视觉连续性,并原生继承 SynthID 水印等安全机制。

    推荐理由:Google 把长视频生成拆成规划、分镜、自回归合成与闭环修正四套框架,读者可了解多智能体如何抑制角色漂移与语义漂移。

  2. Google DeepMind72

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上加入近实时视频生成,让对话模型具备能听、能看、能说的动态视觉形象,并已在 Gemini Enterprise 上线。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的形态变化。

9月24日周四
9月23日周三
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:Google DeepMind 发布两款 TTS 模型,给出语音克隆、逐行导演与安全水印的具体能力,可据此判断语音生成工作流的变化。

9月18日周五
9月16日周三
  1. Google AI Blog60

    Google 公布多语言 AI 进展:Gemini 3.5 Live Translate 支持 70 种语言实时翻译

    Google 表示其技术与产品已覆盖 300 多种语言、服务超 70 亿人,Gemini 3.5 Live Translate 支持 70 种语言、2000 多个语言对的实时口语翻译,并能处理语码转换和情绪线索。

    推荐理由:Google 集中披露多语言语音与翻译能力进展,读者可了解实时翻译、端侧模型与无障碍功能的落地范围。

9月15日周二
  1. Apple Newsroom88

    苹果发布 Siri AI 与新一代 Apple Intelligence

    苹果发布新一代 Apple Intelligence,驱动全新版本 Siri AI,具备个人语境理解、世界知识、屏幕感知和跨应用操作能力,并集成到 iPhone、iPad、Mac 与 Vision Pro。

    推荐理由:官方一次性给出 Siri AI 的能力范围、上线节奏与地区限制,可据此判断苹果 AI 助手的实际可用边界。

9月10日周四
9月2日周三
8月28日周五
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。

    推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力及 API 入口,可据此判断生成视频工作流的可控性变化。

8月27日周四
8月26日周三
8月21日周五
8月20日周四
8月13日周四
  1. Microsoft Research41

    MindTopo 揭示多模态大模型的空间推理短板

    微软研究院推出 MindTopo 基准,用连续性、分离、顺序、包围、绳结五类拓扑任务评测多模态大模型的推理与规划能力。结果显示,模型在静态图像识别上明显强于交互式规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型常在多步动作中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列场景中仍不可靠。

8月12日周三
  1. Google DeepMind74

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布多语种手语转文本模型 SL2T,在 Pixel 11 的 Gboard 和 Live Transcribe 中提供手语听写功能,首发支持美国手语(ASL)转英文,后续将扩展更多设备与语言。

    推荐理由:SL2T 把多语种手语翻译模型落到 Gboard 与 Live Transcribe,读者可了解其数据规模、隐私设计与基准表现。

  2. Microsoft Research34

    微软研究院发布 CARE-X:面向临床可用的放射学 VLM,结合辅助监督、奖励对齐学习与工具增强测量

    微软研究院推出研究模型 CARE-X,一个统一胸片视觉语言模型,可同时输出自由文本推理与结构化预测,覆盖报告生成、病变定位、多标签分类及导管位置检测等任务。该模型采用强化学习(DAPO)在多任务设置下奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证,涵盖罕见 ICU 病理与 CT 确认的增大类病变。CARE-X 为研究模型,未经监管批准,不用于临床诊断。

7月30日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布面向机器人的具身推理模型 Gemini Robotics ER 2,可作为机器人的高层大脑,理解物理世界、规划多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:官方给出 Gemini Robotics ER 2 在进度分类、时刻定位与多机器人协作上的具体指标,可据此判断具身推理模型的当前水位。

7月28日周二
7月21日周二
7月3日周五
7月1日周三
  1. Berkeley AI Research12

    Berkeley BAIR 实验室 2026 届博士毕业生展示

    Berkeley BAIR 实验室展示 2026 届博士毕业生,研究方向覆盖机器人、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 与医疗等领域。毕业生去向包括 OpenAI、Mistral AI、Amazon、Physical Intelligence 等机构,以及 UCLA、普林斯顿 CITP 和芝加哥大学等学术岗位。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,已在 Gemini app、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。

    推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的成绩和速度数据,可供判断前沿模型在延迟与质量间的取舍。

5月12日周二
  1. Google DeepMind74

    Google DeepMind 发布 Co-Scientist 多智能体科研系统

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,可迭代生成、辩论和演化科学假设,并通过“想法锦标赛”以 Elo 排名筛选最优假设。

    推荐理由:DeepMind 公开 Co-Scientist 的多智能体架构与真实科研案例,可了解 AI 参与假设生成的具体流程。

4月30日周四