用 100 步 GRPO 微调 LFM2.5-350M 提升结构化输出
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,就把 IFStruct 基准通过率从 22.6% 提升到 29.7%。
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,就把 IFStruct 基准通过率从 22.6% 提升到 29.7%。
Hugging Face 博主用 TRL 与 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩的方案,模型通过 p5.brush 写出约 150 行 JavaScript 来作画,全部数据集、RL 环境、训练脚本与模型均已开源。
三星电子非洲 CSR 经理 Lefa Makgato 负责领导三星在非洲的企业社会责任项目,其中包括旨在培养非洲学生成为数字创新者的 Solve for Tomorrow。她成长于南非一个小镇,2012 年因接触三星 Solar Powered Internet School 而改变人生轨迹,如今致力于把当年获得的机会回馈给更多学生。
NVIDIA 发布 CUDA 工具链实战教程,用六步增量优化一段图像处理流水线代码,每步只改少量行数。
Google DeepMind 推出 Fairwind Program,面向政府机构、关键基础设施运营商和网络安全合作伙伴提供受限访问,首批开放其最先进的网络安全模型 Gemini 3.8 Flash Cyber 与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
推荐理由:原文给出受限访问计划的能力组合与准入标准,读者可据此判断前沿模型在漏洞修复上的落地方式。
Google DeepMind 发布 Gemini 3.8 Flash 和面向网络安全的 Gemini 3.8 Flash Cyber,前者在软件工程、智能体任务和多步推理上较 3.7 Flash 明显提升,价格保持每百万输入 token 0.75 美元、输出 token 3.75 美元。
推荐理由:Gemini 3.8 Flash 在编码与智能体任务上接近更贵的前沿模型,同时保持 3.7 Flash 的价格,可据此判断性价比取舍。
NVIDIA 开发者博客发布 AI 模型协同设计系列第三篇,探讨如何用投机解码在保持精度的同时加速 LLM 推理,并给出在帕累托前沿上选择草稿长度与草稿机制的五条准则。文章同时讨论了模型设计选择如何在不牺牲精度的情况下影响吞吐量与交互性。
Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 模型与 CodeMender harness,用于自主发现、验证并修复漏洞。
推荐理由:原文给出受限访问计划的能力组合与准入标准,读者可据此判断前沿模型在漏洞修复上的落地方式。
三星将在 IFA 2026 展出两款 Bespoke AI 洗衣机:一款 10 kg 机型能效达 A-70%,比欧洲 A 级最低能效要求省电最多 70%,容量从前代 9 kg 提升至 10 kg;另一款 13 kg 大容量机型采用 SpaceMax 技术,在标准 600 mm 深度、24 英寸机身内扩大内筒。
Hugging Face 发布 BenchMIRT,用多维项目反应理论(MIRT)在单条提示词层面审计 LLM 基准,基于 100 个 LLM、16 个基准、超 34K 道题训练,在未被告知基准对应能力的情况下自行恢复出安全与通用推理两个主导维度。
Google 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体,每百万 token 价格为首发 3.6 Flash 的一半。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、量化并定位全球甲烷点源,在专家标注羽流上召回率达 84%。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,通过原生视频工具动态搜索和检查视频片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态逐帧处理的差异。
NVIDIA 开发者博客介绍用 NVIDIA Nemotron 构建自适应智能体网络安全系统,让智能体在安全运营中协调工作并追求长周期复杂目标。现有许多实现仍依赖既有告警、预定义工作流和已知攻击行为,更难的问题在于识别防御盲区并将这些缺口转化为改进。
Google 在 Workspace 推出图像创建与编辑工具 Google Pics,基于 Nano Banana 图像生成与编辑模型,将在未来几周向所有 Google AI Pro 和 Ultra 订阅者及多数 Workspace 商业客户开放。
推荐理由:Google Pics 基于 Nano Banana 模型,把图像生成与精细编辑放进 Workspace 现有工作流,可据此判断日常制图方式的变化。
NVIDIA 发文讨论企业如何为 AI 推理负载合理配置 GPU 并优化总拥有成本(TCO)。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让 GPU 选型变得困难。
三星电子在 9 月 1-6 日于首尔东大门设计广场(DDP)举办的 Design Miami Seoul 2026 上展出“Design is an Act of Love”。
三星 Galaxy Z 系列在 Galaxy Unpacked July 2026 推出 My FanCam,用户选中视频中某个人物后,该功能会自动全程跟踪其运动。
三星推出 14 英寸 Galaxy Book6,起售价 799 美元,搭载 Intel Core 3 和 Core 5 处理器,单次充电续航最长 25 小时,支持 45W 快充(30 分钟充约 33%)。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行 WebGPU kernel 的 JavaScript 库,同时上线 207 个以独立仓库形式发布的 kernel(Apache-2.0 许可),每个都带有 manifest、正确性用例、基准用例和 WGSL 着色器模板。
推荐理由:Hugging Face 开源 207 个 WebGPU kernel 并给出与 ORT WebGPU 的逐算子对比,可据此判断浏览器端推理的优化空间。
Google 发布 TimesFM-3,这是原生预训练支持多变量预测的时间序列基础模型,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。模型支持多目标、历史协变量和已知未来协变量,通过交替注意力与 Contiguous Patch Masking 在单次前向中输出整个预测区间,并为每个目标给出 10 到 90 分位的 9 个分位数。
NVIDIA BioNeMo NIM 微服务现可在 Claude Science 中运行,用于蛋白质结构预测。该集成面向智能体式 AI 科研流程,让 AI 科学家能够读取论文、提出假设、调用模型并确定后续实验优先级。BioNeMo NIM 此前已在软件工程领域验证价值,如今扩展至更需迭代的科学研究场景。
微软研究院推出 GigaPath-Flash 与 GigaTIME-Flash,以蒸馏 ViT-S 骨干替代原十亿参数编码器,在约 50 倍算力下性能接近原版 GigaPath(差距 3% 以内)。
NVIDIA Omniverse NuRec 用于跨车型平台扩展自动驾驶感知,解决同一套感知软件换到新车型后感知结果变化的问题。传感器布局、标定、视场、遮挡、车身几何、时序与覆盖范围都会随车型改变,例如交通灯在画面中的位置可能不同。
三星于 8 月 27-28 日在 Gamescom 2026 展台举办 #PlayGalaxy Cup 全球总决赛,马来西亚战队夺冠,赛事通过主播 Ludwig 的 YouTube 频道全球直播,累计观看量达 1210 万。
NVIDIA 推出 TensorRT Model Connect,一个开源参考实现集合,可用两条命令把开源模型从 checkpoint 直接跑成 TensorRT 推理。它面向原生 C++ 应用,省去针对具体模型的转换、预处理、后处理和运行时适配代码。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,印地语成为该多语言榜单上的首个印度语言。
三星发布 Galaxy S26 FE,成为 Galaxy S26 系列中首款搭载 One UI 9 的机型,9 月 4 日起在部分市场开售,提供 Blueberry、Graphite、Pistachio 三色。
Google 在 Earth AI 计划下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程压缩到几分钟。
三星在 Gamescom 2026 公布 2027 Odyssey 电竞显示器阵容,包含全球首款 49 英寸 DQHD 360Hz 的 Odyssey OLED G9、全球首款 42 英寸 16:9 曲面 OLED 的 Odyssey OLED G7,以及全球首款 1100Hz 的 27 英寸 Odyssey G6。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。
推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力及 API 入口,可据此判断生成视频工作流的可控性变化。
Google 为 Search 的 AI Mode 加入三项旅行能力:航班价格追踪、积分或里程价格查询,以及酒店预订。
推荐理由:Google 把航班价格追踪、积分里程比价和酒店预订整合进 AI Mode,读者可据此判断搜索入口正在承接交易闭环。
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学隔离环境中,避免模型提前接触测试题目。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite,以提升评测可信度。
三星 Galaxy Z Flip8 是迄今最薄最轻的 Galaxy Z Flip,其升级的外屏 FlexWindow 让用户无需展开手机即可拍照、使用常用应用并体验智能体 AI。三星新闻室用视频展示了 FlexWindow 如何简化日常生活。
NVIDIA 发布 NVLink Fusion,为下一代 AI 基础设施带来 NVHBM。原文指出,AI 工厂需支撑越来越大的模型和更复杂的推理负载,超大规模厂商与 AI 原生公司正在开发自研 AI 加速器 XPU,而规模化部署这些加速器需要高带宽内存(HBM)以及足够的封装和硅面积来支撑更多算力。
推荐理由:NVIDIA 官方介绍 NVLink Fusion 如何把 NVHBM 引入下一代 AI 基础设施,可了解其面向 XPU 的互连与内存思路。
NVIDIA 介绍了一套用 AI 智能体训练跨本体机器人导航策略的方法,让导航能力迁移到新机器人或新场景时不再需要重新准备数据、仿真资产和机器人接口。导航与运动控制不同,需持续定位、理解变化的环境、选择路线并避障。
Google 推出自监督基础模型 GlucoFM,采用双流设计分离血糖的慢速基线趋势与短期波动,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖 477 条受试者/会话记录,在 4 个队列、7 项临床任务共 14 组评估中平均 PR-AUC 较最佳 GluFormer 变体高 5.8 个百分点,并在 Dexcom 与 Libre 两款设备上取得最低 MAE。
阿里发布 Qwen3.8-Flash-Next 的模型权重,作为即将推出的 Qwen4 架构预览,供开发者实验和评估。该模型是多模态 MoE 模型,主模型 125B 参数,另有 51B N-gram 嵌入向量,每 token 激活 6B 参数,原生上下文窗口 262,144 token,可扩展至 1M token。NVIDIA 开发者博客介绍了在 GB300 NVL72 上针对智能体编码的实验。
推荐理由:阿里开放 Qwen3.8-Flash-Next 权重供开发者试用,可据此了解 Qwen4 架构预览版的 MoE 规格与长上下文能力。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转成准确、格式化后的文本。
推荐理由:Gemini 3.5 Transcribe 给出了 WER、延迟与多语言数据,读者可据此判断语音转写在实际产品中的可用程度。
三星在 Gamescom 2026 发布 USB4 便携 SSD P9 和 P7,P9 顺序读取最高 4,000MB/s、写入 3,800MB/s,约为上代两倍,并称是全球首款 8TB USB4 便携 SSD。