Google Research 提出 Diffusion Controller,统一并简化 AI 图像生成控制
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,通过轻量附加网络在不改动基座模型权重的前提下引导生成。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,通过轻量附加网络在不改动基座模型权重的前提下引导生成。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调。
在 Amazon SageMaker AI 上,同一 AWS vLLM-Omni DLC 镜像可部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。
NVIDIA 发布 DLSS 5,引入 DLSS 3D-Guided Neural Rendering 和细粒度控制,帮助游戏开发者在保留艺术意图的同时加入更逼真的光照与材质细节。官方同时介绍了 NVIDIA ACE 的更新,以及 RTX Mega Geometry 2.0 和 RTX Kit 在角色 AI、高密度几何与渲染工作流方面的能力变化。
推荐理由:NVIDIA 官方说明 DLSS 5 的 3D 引导神经渲染与细粒度控制,并同步更新 ACE 与 RTX Kit,可了解游戏渲染与角色 AI 的新工具链。
Google 旗下 Envisioning Studio 与 Google Labs 合作,用 AI 创作工具 Google Flow 为设计师 Jane Wade 和 Sergio Hudson 分别打造 Styling Suite 与 Runway Visualization 两款定制工具,用于纽约时装周。
三星 Galaxy Z 系列(Galaxy Unpacked July 2026 发布)的人像视频功能通过 AI 视频处理与真实镜头光学分析,复刻大光圈镜头的景深与 Bokeh 效果,虚化程度随主体与背景距离自然变化。用户可在拍摄后切换对焦主体,并将虚化程度从 0 调至 7。该功能由三星研究院与 MX 业务部门联合开发,后者将其优化并落地到设备。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 的大部分功能重建为一张包含 73 个节点、11 条媒体管线的画布,涵盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 式标注器、背景移除、PNG Info 与图生视频。
推荐理由:原文完整拆解了用 Gradio Workflow 重建 A1111 的十一条管线,读者可据此判断节点式画布能否替代 ComfyUI 工作流。
Google DeepMind 与导演 Liz Garbus、Darren Aronofsky 的 Primordial Soup 合作,在短片《Love, Rendered》中用生成模型修复 Burt 和 Ethelle Shatz 年轻时的黑白照片,并通过表演捕捉模型将两人当下的微表情与姿态映射到年轻形象上,重建他们未曾被拍摄的初遇场景。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。
推荐理由:官方给出 ChatGPT Images 2.5 的定位,读者可了解它在个性化图像生成上的能力方向。
三星在 IFA Innovation Awards 2026 上凭多款家电获奖,Bespoke AI WindFree Pro 空调拿下 Best in Design 类别优胜,并入选 Best in Home Appliances。
Google 在 Workspace 推出图像创建与编辑工具 Google Pics,基于 Nano Banana 图像生成与编辑模型,将在未来几周向所有 Google AI Pro 和 Ultra 订阅者及多数 Workspace 商业客户开放。
推荐理由:Google Pics 基于 Nano Banana 模型,把图像生成与精细编辑放进 Workspace 现有工作流,可据此判断日常制图方式的变化。
三星电子于 9 月 1 日至 6 日在首尔东大门设计广场(DDP)举办 Design Miami Seoul 2026 特展“Design Is an Act of Love”。14 位韩国艺术家以三星产品为灵感创作原创作品,每件作品经 AI 呈现于 OLED TV S95H,并配以成为作品一部分的定制画框。
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:Diffusers 原生接入 Nunchaku 4-bit 推理,给出显存与延迟对比数据,可据此判断消费级 GPU 跑扩散模型的门槛变化。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中证明,扩散模型的创造力并非随机偶然,而是神经网络训练中权重衰减等正则化带来的"分数平滑"所致。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型给出了延迟、价格与可用入口,读者可据此判断图像与视频生成工作流的成本变化。
Google Research 公布两项关于 AI 辅助皮肤问题理解的研究,其中发表于 JAMA Dermatology 的论文让 2,345 名参与者分别使用标准搜索、AI 工具和"Wizard of Oz"工具,AI 组尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,约为对照组 8% 的近三倍。
Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言对话逐轮编辑视频。
推荐理由:Gemini Omni Flash 把多模态输入与对话式视频编辑结合,读者可了解其能力边界与首批上线渠道。
Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新方法,把照片理解为 3D 场景并自动调整相机位置和焦距,生成原本未拍到的视角。该方法分两步:先用内部 3D 点图估计模型重建人体和面部并估算焦距,再用生成式潜在扩散模型填补新视角下出现的空洞。该功能已面向含人物的照片自动提供重新构图版本,作为 Auto frame 候选中的第二个选项。
推荐理由:原文拆解了 Google Photos 自动取景如何用 3D 场景估计加生成式补全改变拍摄视角,可了解生成式编辑的新思路。
Google 发布两个学术智能体框架:PaperVizAgent 负责生成论文配图,ScholarPeer 负责自动同行评审。PaperVizAgent 由检索、规划、风格、可视化、评审五个智能体协作,在 0-100 分评测中整体得分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any 等基线,也是唯一超过 50.0 人类基线的框架。
Berkeley AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,在彩色摄影、射电天文、无透镜成像和显微镜四个领域预测解码器性能。该方法用已知噪声物理直接计算 H(Y|X),仅需学习 H(Y),优化后的设计在更少内存和算力、无需任务专用解码器的情况下达到与端到端方法相当的水平。