跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果、Android 与 Pixel 生态的持续追踪。

最新精选

第 61–78 条 · 共 78 条
5月17日周日
5月16日周六
  1. Google DeepMind60

    WeatherNext 如何帮助美国国家飓风中心预测飓风 Melissa 登陆牙买加

    Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。

    推荐理由:原文给出 WeatherNext 在飓风路径与强度预测上的实际表现,读者可了解 AI 天气模型如何辅助官方预警决策。

  2. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,已在 Gemini app、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。

    推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的成绩和速度数据,可供判断前沿模型在延迟与质量间的取舍。

5月12日周二
  1. Google DeepMind74

    Google DeepMind 发布 Co-Scientist 多智能体科研系统

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,可迭代生成、辩论和演化科学假设,并通过“想法锦标赛”以 Elo 排名筛选最优假设。

    推荐理由:DeepMind 公开 Co-Scientist 的多智能体架构与真实科研案例,可了解 AI 参与假设生成的具体流程。

5月6日周三
  1. Google DeepMind75

    DeepMind 详解 AlphaEvolve 一年成果:从基因组到 TPU 设计

    Google DeepMind 发布 AlphaEvolve 一年成果汇总,这款由 Gemini 驱动的编码智能体已从试点进入 Google 基础设施核心环节,用于优化下一代 TPU 设计、缓存替换策略与 Spanner 存储。

    推荐理由:DeepMind 汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、量子与 TPU 设计,可了解编码智能体在科研与基础设施中的实际作用。

4月30日周四
4月23日周四
  1. Google Research60

    Google Photos 上线 Auto frame 新功能,可自动改变照片拍摄视角

    Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新方法,把照片理解为 3D 场景并自动调整相机位置和焦距,生成原本未拍到的视角。该方法分两步:先用内部 3D 点图估计模型重建人体和面部并估算焦距,再用生成式潜在扩散模型填补新视角下出现的空洞。该功能已面向含人物的照片自动提供重新构图版本,作为 Auto frame 候选中的第二个选项。

    推荐理由:原文拆解了 Google Photos 自动取景如何用 3D 场景估计加生成式补全改变拍摄视角,可了解生成式编辑的新思路。

4月22日周三
  1. Google DeepMind62

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步通信的计算孤岛,降低带宽需求并隔离硬件故障。测试中该系统在整块 learner unit 掉线后仍能继续训练并重新接入,用 Gemma 4 模型达到与传统训练相当的基准性能。

    推荐理由:原文给出跨数据中心异步训练在带宽、容错与混合硬件上的实测结果,可据此判断分布式预训练的工程取舍。

4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,主打更强的可控性、表现力与音质,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。

    推荐理由:Gemini 3.1 Flash TTS 的音频标签与多说话人能力,展示了语音生成从朗读走向可导演式控制的方向。

4月13日周一
  1. Google DeepMind72

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,增强了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计等复杂仪表。

    推荐理由:Gemini Robotics-ER 1.6 升级了空间推理与多视角理解,并新增仪表读数能力,可了解机器人在真实场景中的自主性进展。

3月31日周二
  1. Google Research62

    Google Quantum AI 发布白皮书:量子计算机破解加密货币加密所需资源大幅下降

    Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线加密(ECDLP-256)所需的量子比特和门数比此前认为的更少。

    推荐理由:Google Quantum AI 更新了破解 ECDLP-256 所需的量子资源估算,并给出面向加密货币社区的 PQC 迁移与负责任披露建议。

3月25日周三
  1. Google Research60

    Google 发布 Vibe Coding XR,用 Gemini 与 XR Blocks 把自然语言变成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架,可将自然语言提示词直接转成具备物理感知的 Android XR 应用,官方称耗时在 60 秒以内。

    推荐理由:Google 官方给出 Vibe Coding XR 的完整工作流与 VCXR60 初步评测,可了解自然语言生成 XR 应用的实际成功率与限制。

3月18日周三
3月12日周四
  1. Google Research69

    Google 在 Flood Hub 上线城市山洪预报,提前 24 小时预警

    Google 宣布在 Flood Hub 上线城市山洪预报,可提前最多 24 小时预测城市山洪风险。该模型基于 RNN 与 LSTM 架构,使用 Gemini 从公开新闻报道中提取历史山洪事件构建 Groundsource 数据集进行训练,目前以 20x20 公里分辨率运行,覆盖人口密度超过每平方公里 100 人的区域。

    推荐理由:Google 把城市山洪预警扩展到 Flood Hub,读者可了解其用 Gemini 从新闻中提取训练数据的方法与全球覆盖思路。

  2. Google Research60

    Google 推出 Groundsource,用 Gemini 将新闻报道转为灾害数据

    Google 发布 Groundsource,一种用 Gemini 从非结构化新闻中提取灾害事件的方法,首个开放数据集收录 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。

    推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,构建 260 万条历史数据集,并给出人工核验的准确率。

  3. Google Research62

    Google 与 BIDMC 开展 AMIE 对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频实时监督。

    推荐理由:Google 与 BIDMC 首次在真实门诊流程中部署 AMIE 做就诊前问诊,读者可了解其安全监督机制与诊断表现。