苹果三款新智能家居产品 10 月 13 日发布:智能家居中枢、新 HomePod mini 与新 Apple TV
苹果计划于 10 月 13 日(周二)推出智能家居中枢设备、新款 HomePod mini 和新款 Apple TV,三款产品均主打 Siri AI。新 HomePod mini 与 Apple TV 沿用现有设计但换用更快芯片,HomePod mini 新增粉色和绿色配色。三款产品原定 2024 年发布,因 Siri AI 而推迟;更大尺寸 HomePod 将在后续更新。
苹果计划于 10 月 13 日(周二)推出智能家居中枢设备、新款 HomePod mini 和新款 Apple TV,三款产品均主打 Siri AI。新 HomePod mini 与 Apple TV 沿用现有设计但换用更快芯片,HomePod mini 新增粉色和绿色配色。三款产品原定 2024 年发布,因 Siri AI 而推迟;更大尺寸 HomePod 将在后续更新。
苹果长期传闻的智能家居中枢将采用 iMac G4 风格设计,配备 6 英寸方形屏幕,有台面放置和壁挂两个版本,壁挂版代号 J491。设备无电池需持续供电,通过 USB-C 供电,无音量键和电源键,正面配一枚 FaceTime 摄像头,支持语音与面部识别,识别失败时可用 iPhone 二次验证。该设备据称将于 10 月 13 日与新 HomePod mini 和 Apple TV 一同推出。
Apple Watch Series 12 和 Apple Watch Ultra 4 将于今年晚些时候获得 Siri Recap 与 Live Rewind 两项新功能。Siri Recap 由 Apple Intelligence 生成对话摘要,未保存的摘要 7 天后自动删除;Live Rewind 则在双击 Digital Crown 后显示过去 15 秒的语音文字片段。
Mobvoi 发布 TicNote Watch 智能手表,可脱离手机完成对话的录制、转写与摘要,主打 AI 笔记功能。该手表售价 249 美元,限时优惠价 199 美元,目标用户为记者、医疗从业者、咨询顾问等会议密集人群。
据 Bloomberg 报道,苹果计划于 10 月 13 日发布一款智能显示屏(代号 J490 和 J491)、升级版 HomePod mini 2 以及更快的 Apple TV 4K。其中智能屏采用六英寸方形屏幕,支持动态面部与语音用户识别,系统融合了 iPadOS、watchOS 与 iOS 的 StandBy 模式元素。这批硬件将作为苹果改版后由 LLM 驱动的新 Siri 的展示载体。
三星发布首款耳夹式耳机 Galaxy Buds On,采用不插入耳道的夹式结构,满电音乐播放续航最长 9.5 小时。产品搭载高通 Snapdragon S7 Gen 1 声音平台与 TwinBoost 扬声器技术,支持头部手势识别点头 / 摇头来接听挂断电话、关闭闹钟和读取通知。该耳机 10 月 27 日在韩国率先上市,仅提供黑色版本,售价 299,000 韩元。
三星悄然推出旗下首款耳夹式无线耳机 Galaxy Buds On,搭载 TwinBoost 扬声器、防漏音和自动音量控制,续航最长 9.5 小时,并支持 Gemini Live、Quick Voice Memo 和头部手势等 Galaxy AI 功能。该产品将于 10 月 27 日在韩国首发,售价 299,000 韩元,随后在全球上市。
NVIDIA 对 Nemotron 模型进行微调,以提升沙特阿拉伯语方言的自动语音识别能力,并给出可迁移到其他语言的路径。该方法针对预训练数据中代表性不足的地区方言和本地录音条件,指出在多语言基准上表现良好的模型在实际部署中仍可能不达标。
Google Home 推送更新,为 Gemini 音箱的“Hey Google, find my phone”指令带来质量与可靠性改进,并优化背景噪音过滤、响应速度、多语言家庭支持和 Routines 自定义指令。
Google Home 推送九月第三次更新,让 Gemini for Home 在嘈杂房间中更准确地识别指令并加快响应速度。此次更新还改进了 Find My Phone 可靠性、多语言识别、智能灯控、摄像头卡片和设备设置,并修复了 Matter 开关、Favorites 卡片、摄像头回放、Onn 摄像头历史记录及 Automations 等问题。
AI 语音初创公司 ElevenLabs 宣布允许员工以 220 亿美元估值套现部分已归属股权,较今年 2 月融资时的 110 亿美元估值翻倍。此次 3 亿美元 tender offer 由 Wellington 和 T. Rowe Price 联合领投,是该公司第二次为员工安排二级交易,上一次是 2025 年 9 月以 66 亿美元估值进行的 1 亿美元 tender。
Hugging Face 上线 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Pixel Buds 应用更新至 1.0.981607934 版本后,Gemini 新增“Connected App”入口,可通过语音控制 EQ 预设、ANC 模式、对话检测和触控设置。该版本已在 Play Store 广泛推送;Google 此前预告的 Dynamic ANC、Pixel Watch 睡眠同步和轻触启动 Live translate 预计还需固件更新。
AWS 发布 vLLM-Omni DLC(v1.5),可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上加入近实时视频生成,让对话模型具备能听、能看、能说的动态视觉形象,并已在 Gemini Enterprise 上线。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的形态变化。
Simon Willison 发布 Gemini 3.8 TTS Playground,一个自带 API key 的交互界面,可合成单人或多人对话语音、预览音频并查看请求与响应细节,设置可保存为可分享的 URL。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:Google DeepMind 发布两款 TTS 模型,给出语音克隆、逐行导演与安全水印的具体能力,可据此判断语音生成工作流的变化。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度多步推理任务。
推荐理由:两款语音对话模型同时发布,给出基准成绩与开发者接入渠道,可据此判断语音智能体的可用性。
Google 表示其技术与产品已覆盖 300 多种语言、服务超 70 亿人,Gemini 3.5 Live Translate 支持 70 种语言、2000 多个语言对的实时口语翻译,并能处理语码转换和情绪线索。
推荐理由:Google 集中披露多语言语音与翻译能力进展,读者可了解实时翻译、端侧模型与无障碍功能的落地范围。
苹果发布 iOS 27、iPadOS 27、macOS 27、watchOS 27 和 visionOS 27,Siri AI 以英文测试版上线,10 月增加法语、日语、韩语、葡萄牙语和西班牙语支持。
推荐理由:Siri AI 与 Apple Intelligence 新能力随 iOS 27 等系统上线,可了解其功能范围与分阶段开放节奏。
苹果发布新一代 Apple Intelligence,驱动全新版本 Siri AI,具备个人语境理解、世界知识、屏幕感知和跨应用操作能力,并集成到 iPhone、iPad、Mac 与 Vision Pro。
推荐理由:官方一次性给出 Siri AI 的能力范围、上线节奏与地区限制,可据此判断苹果 AI 助手的实际可用边界。
苹果发布 AirPods 5,采用全新多端口声学架构和下一代自适应 EQ,开放式主动降噪相比 AirPods 4 可多消除 50% 外部噪音。搭配 Apple Intelligence 支持的 iPhone,用户可免手动调用 Siri AI,并通过头部手势回应或使用实时翻译。AirPods 5 今日开启预购,售价 129 美元,无线充电盒版 149 美元,9 月 18 日到店。
Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体,每百万 token 价格为首发 3.6 Flash 的一半。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化后的文本。
推荐理由:Gemini 3.5 Transcribe 给出了 WER、延迟与多语言数据,读者可据此判断语音转写在实际产品中的可用程度。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升,包括更复杂自然的旋律结构、更高的提示词遵循度与结构感知、更具情感和发音更准的人声,以及对节奏和时长的更便捷控制。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,主打更强的可控性、表现力与音质,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。
推荐理由:Gemini 3.1 Flash TTS 的音频标签与多说话人能力,展示了语音生成从朗读走向可导演式控制的方向。