NVIDIA Nemotron 微调适配沙特阿拉伯语方言,并可扩展至其他语言
NVIDIA 对 Nemotron 模型进行微调,以提升沙特阿拉伯语方言的自动语音识别能力,并给出可迁移到其他语言的路径。该方法针对预训练数据中代表性不足的地区方言和本地录音条件,指出在多语言基准上表现良好的模型在实际部署中仍可能不达标。
NVIDIA 对 Nemotron 模型进行微调,以提升沙特阿拉伯语方言的自动语音识别能力,并给出可迁移到其他语言的路径。该方法针对预训练数据中代表性不足的地区方言和本地录音条件,指出在多语言基准上表现良好的模型在实际部署中仍可能不达标。
Hugging Face 上线 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
AWS 发布 vLLM-Omni DLC(v1.5),可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出。
阿里云 Qwen 团队的 Qwen3-TTS-12Hz-1.7B-Base 已上架 Amazon SageMaker JumpStart,可部署为全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上加入近实时视频生成,让对话模型具备能听、能看、能说的动态视觉形象,并已在 Gemini Enterprise 上线。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解多模态对话在企业场景中的形态变化。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:Google DeepMind 发布两款 TTS 模型,给出语音克隆、逐行导演与安全水印的具体能力,可据此判断语音生成工作流的变化。
Ringg 基于 GPT-5.6 构建的多语言 AI 智能体可解决最高 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页渠道。相比 GPT-4.1,其成本降低 90%。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度多步推理任务。
推荐理由:两款语音对话模型同时发布,给出基准成绩与开发者接入渠道,可据此判断语音智能体的可用性。
Google 表示其技术与产品已覆盖 300 多种语言、服务超 70 亿人,Gemini 3.5 Live Translate 支持 70 种语言、2000 多个语言对的实时口语翻译,并能处理语码转换和情绪线索。
推荐理由:Google 集中披露多语言语音与翻译能力进展,读者可了解实时翻译、端侧模型与无障碍功能的落地范围。
苹果发布 iOS 27、iPadOS 27、macOS 27、watchOS 27 和 visionOS 27,Siri AI 以英文测试版上线,10 月增加法语、日语、韩语、葡萄牙语和西班牙语支持。
推荐理由:Siri AI 与 Apple Intelligence 新能力随 iOS 27 等系统上线,可了解其功能范围与分阶段开放节奏。
苹果发布新一代 Apple Intelligence,驱动全新版本 Siri AI,具备个人语境理解、世界知识、屏幕感知和跨应用操作能力,并集成到 iPhone、iPad、Mac 与 Vision Pro。
推荐理由:官方一次性给出 Siri AI 的能力范围、上线节奏与地区限制,可据此判断苹果 AI 助手的实际可用边界。
OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话,并带来更强的指令遵循、自定义音色和电话通信支持。
推荐理由:OpenAI 把全双工语音对话能力开放到 API,读者可据此判断语音应用的接入门槛变化。
苹果发布 AirPods 5,采用全新多端口声学架构和下一代自适应 EQ,开放式主动降噪相比 AirPods 4 可多消除 50% 外部噪音。搭配 Apple Intelligence 支持的 iPhone,用户可免手动调用 Siri AI,并通过头部手势回应或使用实时翻译。AirPods 5 今日开启预购,售价 129 美元,无线充电盒版 149 美元,9 月 18 日到店。
三星宣布自 9 月起向部分在售冰箱和洗衣家电推送 Tizen OS 10.0 更新,使其获得今年新品同款服务与功能。
Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体,每百万 token 价格为首发 3.6 Flash 的一半。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化后的文本。
推荐理由:Gemini 3.5 Transcribe 给出了 WER、延迟与多语言数据,读者可据此判断语音转写在实际产品中的可用程度。
三星 Galaxy Buds4 Pro 获得 EISA 2026-2027 入耳式耳机奖,这是 Galaxy Buds 系列首次拿下该奖项。EISA 评价其双路扬声器配独立功放带来干净的音乐细节,Sensor Fusion 技术结合 VPU 与 DNN 降噪保证通话清晰。该耳机采用加宽低音单元,有效发声面积较上代增加近 20%,支持 24-bit/96 kHz UHQ 音频与自适应 ANC。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升,包括更复杂自然的旋律结构、更高的提示词遵循度与结构感知、更具情感和发音更准的人声,以及对节奏和时长的更便捷控制。
Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70 多种语言的近实时语音到语音翻译,能自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:Google 发布 Gemini 3.5 Live Translate,读者可了解其连续语音翻译机制与在 Google 产品中的落地节奏。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,主打更强的可控性、表现力与音质,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。
推荐理由:Gemini 3.1 Flash TTS 的音频标签与多说话人能力,展示了语音生成从朗读走向可导演式控制的方向。