Google DeepMind 发布 Gemini Omni 1.1 Flash
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。
推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力及 API 入口,可据此判断生成视频工作流的可控性变化。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。
推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力及 API 入口,可据此判断生成视频工作流的可控性变化。
Google 为 Search 的 AI Mode 加入三项旅行能力:航班价格追踪、积分或里程价格查询,以及酒店预订。
推荐理由:Google 把航班价格追踪、积分里程比价和酒店预订整合进 AI Mode,读者可据此判断搜索入口正在承接交易闭环。
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学隔离环境中,避免模型提前接触测试题目。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite,以提升评测可信度。
三星 Galaxy Z Flip8 是迄今最薄最轻的 Galaxy Z Flip,其升级的外屏 FlexWindow 让用户无需展开手机即可拍照、使用常用应用并体验智能体 AI。三星新闻室用视频展示了 FlexWindow 如何简化日常生活。
NVIDIA 发布 NVLink Fusion,为下一代 AI 基础设施带来 NVHBM。原文指出,AI 工厂需支撑越来越大的模型和更复杂的推理负载,超大规模厂商与 AI 原生公司正在开发自研 AI 加速器 XPU,而规模化部署这些加速器需要高带宽内存(HBM)以及足够的封装和硅面积来支撑更多算力。
推荐理由:NVIDIA 官方介绍 NVLink Fusion 如何把 NVHBM 引入下一代 AI 基础设施,可了解其面向 XPU 的互连与内存思路。
NVIDIA 介绍了一套用 AI 智能体训练跨本体机器人导航策略的方法,让导航能力迁移到新机器人或新场景时不再需要重新准备数据、仿真资产和机器人接口。导航与运动控制不同,需持续定位、理解变化的环境、选择路线并避障。
Google 推出自监督基础模型 GlucoFM,采用双流设计分离血糖的慢速基线趋势与短期波动,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖 477 条受试者/会话记录,在 4 个队列、7 项临床任务共 14 组评估中平均 PR-AUC 较最佳 GluFormer 变体高 5.8 个百分点,并在 Dexcom 与 Libre 两款设备上取得最低 MAE。
阿里发布 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构预览,供开发者实验和评估。该模型是多模态 MoE 模型,主模型 125B 参数,另有 51B N-gram 嵌入向量,每 token 激活 6B 参数,原生上下文窗口 262,144 token,可扩展至 1M token。NVIDIA 开发者博客介绍了在 GB300 NVL72 上针对智能体编码的实验。
推荐理由:阿里开放 Qwen3.8-Flash-Next 权重供开发者试用,可据此了解 Qwen4 架构预览版的 MoE 规格与长上下文能力。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化后的文本。
推荐理由:Gemini 3.5 Transcribe 给出了 WER、延迟与多语言数据,读者可据此判断语音转写在实际产品中的可用程度。
三星在 Gamescom 2026 发布 USB4 便携 SSD P9 和 P7,P9 顺序读取最高 4,000MB/s、写入 3,800MB/s,约为上代两倍,并称是全球首款 8TB USB4 便携 SSD。
三星新一代 Galaxy Z Fold8 Ultra、Galaxy Z Fold8 和 Galaxy Z Flip8 在欧洲创下预售纪录后,早期消费者评价平均达 4.8 星(满分 5 星)。其中 Galaxy Z Fold8 占该系列欧洲预售量 40% 以上,Flip8 配备 6.9 英寸主屏与增强版 FlexWindow。三款机型现已在 Samsung.com 开售。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 式后期交互检索,并给出完整训练方案。
NVIDIA Dynamo 新增预览功能 Shadow Engine Recovery,可在 LLM 引擎进程故障后数秒内恢复推理容量,替代需从存储加载权重到 HBM、编译 kernel 并捕获 CUDA graphs 的冷重启流程。大模型冷启动初始化通常耗时数分钟,期间存活 worker 需承接转移流量。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的高层推理映射为 XR 中与语音同步的手势,让智能体在用户真实环境中指点、演示动作。系统通过眼动与场景重建注册物体并生成 3D 边界框,手势库覆盖指示、象形和表达三类语义。在 N=12 的对照研究中,AgentHands 相比纯语音基线在空间定位等指标上取得显著提升。
Google Search 推出 5 种家居装饰用法:AI Mode 可上传房间照片预览沙发等家具摆放效果,Lens 拍照识别复古单品并找同款,Circle to Search 在 Pixel 和 Samsung Galaxy S26 上圈选视频或社交帖中的装饰找相似款。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个稠密 decoder-only 规模,基于 Granite-4.1 基座后训练而来,全部采用 Apache 2.0 许可。
推荐理由:Granite 4.2 完整公开了从预训练到多阶段 RL 的构建细节,可对照其数据配比与奖励设计理解推理模型的训练路径。
NVIDIA 发布 CUDA Python 1.0,主打稳定 API、统一基础和全平台访问。文章回顾了 Python 开发者使用 GPU 的两条路径,一是自己用 CUDA C++ 写扩展并维护绑定,二是依赖 PyTorch、CuPy、RAPIDS 等上层库,后者虽让 Python GPU 生态繁荣但存在局限。
推荐理由:CUDA Python 1.0 把稳定 API 与全平台访问作为目标,读者可据此判断 Python 开发者接入 GPU 的路径变化。
三星电子于 9 月 1 日至 6 日在首尔东大门设计广场(DDP)举办 Design Miami Seoul 2026 特展“Design Is an Act of Love”。14 位韩国艺术家以三星产品为灵感创作原创作品,每件作品经 AI 呈现于 OLED TV S95H,并配以成为作品一部分的定制画框。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4 后,在 9 项基准中有 7 项超过该架构的 bfloat16 全精度版本。
三星将在 8 月 26-30 日于德国科隆举办的 Gamescom 2026 上,以 1,090 平方米展区展示覆盖 PC、主机与手游的游戏生态,并首发 2027 Odyssey 游戏显示器全系与新款便携 SSD。
三星在 One UI 9 上为第八代 Galaxy Z 系列升级 Smart Switch,iOS 用户无需单独安装应用,扫描新机上的二维码即可开始传输数据,并支持无线连接。
Gradio 内置的 gr.Workflow 把多步 AI 管线描述为带类型节点的图,并直接生成可拖拽运行的画布界面。每个输出节点同时成为以标签命名的 REST 端点,可用 Gradio client 或 curl 调用,也能一键部署到 Hugging Face Spaces。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发和 AI 解决方案部署,初期聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。
生成式 AI 推动分布式模型训练扩展至数十万块 GPU,节点间的 scale-out 网络成为首要性能瓶颈。NVIDIA 指出,传统商用 Ethernet 虽长期主导企业与云网络,但已难以支撑这一规模。Spectrum-X Ethernet 被定位为针对 Giga-Scale AI 的网络方案。
NVIDIA 称 Vera Rubin 与 Blackwell 为智能体 AI 的每瓦性能树立新标准。OpenRouter《State of AI》报告基于 100 万亿 token 的真实使用数据发现,平均每请求提示词 token 量增长约四倍,反映 AI 智能体推理已从单轮交互扩展为多步工作流。
NVIDIA 介绍 Groq 3 LPX,这是面向 NVIDIA Vera Rubin 平台的交互式 AI 推理加速器。平台核心是 NVIDIA Vera Rubin NVL72,覆盖从小模型到大模型、开源与闭源在内的广泛 AI 工作负载,兼顾高吞吐与交互性;Groq 3 LPX 与 Vera Rubin NVL72 搭配可扩展该平台的能力。
推荐理由:原文说明 Groq 3 LPX 与 Vera Rubin NVL72 的搭配方式,读者可了解长上下文交互推理的硬件组合思路。
NVIDIA BlueField-4 面向智能体 AI 工厂提供新型 Scale-In 网络基础设施,用于支撑每服务器多太比特带宽下的线速网络、存储与安全处理。传统云基础设施面向可预测的通用工作负载和标准接口设计,而智能体 AI 工厂需连接多样用户、智能体、应用、数据源与存储系统至大规模加速计算,因此专用 DPU 处理成为必需。
NVIDIA 发布 DSX MaxLPS,用于提升 AI 工厂的每瓦性能。AI 工厂是受功耗约束的工业系统,对 AI 推理负载而言,应用层每瓦性能已成为衡量 AI 工厂效率的关键指标,因为配电、冷却等环节会消耗部分功耗,并非每兆瓦都能转化为产生收入的算力。
NVIDIA 指出,智能体 AI 负载高度不可预测且波动大,与传统计算稳定的运行时特征不同。在 AI 工厂中,GPU 负责运行模型,CPU 则承担编排、工具执行与沙箱计算,集群经济性取决于整栈将电力与资本转化为已完成智能体任务的效率。
METR 研究显示 AI 对科学的加速并不均衡:2026 年 cURL、OpenSSL、Firefox 等项目的漏洞报告速度较 2025 年大幅加快,数学领域 arXiv 投稿在部分方向不到 12 个月翻倍,而 AI 研究本身的算法进展尚无显著加速。
三星 Galaxy Buds4 Pro 获得 EISA 2026-2027 入耳式耳机奖,这是 Galaxy Buds 系列首次拿下该奖项。EISA 评价其双路扬声器配独立功放带来干净的音乐细节,Sensor Fusion 技术结合 VPU 与 DNN 降噪保证通话清晰。该耳机采用加宽低音单元,有效发声面积较上代增加近 20%,支持 24-bit/96 kHz UHQ 音频与自适应 ANC。
Google 发布 Biomarker Discovery Framework,一个在人类监督下把候选生物标志物筛选组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢类候选标志物,例如睡眠时长变异性与 PHQ-8 严重度的关联(ρ = 0.252)。
NVIDIA 介绍 GPU 加速矩阵分解算法 AdaptGrow,可将滚动相关性与尾部依赖矩阵转化为硬聚类、软因子载荷和结构突变信号,支持单 GPU 与多节点规模。该方法面向量化策略中的投资组合构建、风险聚合、统计套利和交易监控等场景,错误的工具分组会带来风险。
三星在 IDEA 2026 获 1 项 Impact Award、9 项 Bronze 和 35 项 Finalist,并在红点设计奖 2026 品牌与传达设计类别拿下 12 项奖,含 1 项 Best of the Best。
NVIDIA 宣布其 AVO 在 ARC-AGI-3 上达到 100%,称其展示了面向长时程自主智能体的前沿级通用架构。文章指出前沿语言模型只是 AI 智能体的一部分,外围的 harness 决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中保持进展。
推荐理由:NVIDIA 公布 AVO 在 ARC-AGI-3 上的成绩,读者可了解其面向长时程自主智能体的架构思路。
Google DeepMind 回顾了 15 年游戏 AI 研究历程,从 DQN 在 49 款 Atari 2600 游戏中学会游玩,到 AlphaGo、AlphaZero、MuZero 和 AlphaStar 在围棋、国际象棋与 StarCraft II 中达到 Grandmaster 水平。
Google Research 提出 ME-POIs 框架,将匿名聚合的移动性数据(到达时间、停留时长、周边移动模式)与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三类探针量化语音识别中的基准优化现象,测试了 11 个开源 ASR 模型。
推荐理由:研究用三类探针量化 ASR 模型的基准优化现象,并给出可复用的检测脚本与榜单入口。
Papers with Code 用 Hugging Face Jobs、Storage Buckets 和 Inference Endpoints 搭建混合搜索系统,为超 11 万篇 arXiv 与 Daily Papers 论文提供检索。
Liquid AI 为 LFM2.5 系列三款模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升推理速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。