Condé Nast 如何用 Amazon Bedrock 构建多模态视频检索
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
NVIDIA 对 Nemotron 模型进行微调,以提升沙特阿拉伯语方言的自动语音识别能力,并给出可迁移到其他语言的路径。该方法针对预训练数据中代表性不足的地区方言和本地录音条件,指出在多语言基准上表现良好的模型在实际部署中仍可能不达标。
三星发布 Galaxy Tab S12 系列,包含 Galaxy Tab S12 Ultra 和 Galaxy Tab S12+,搭载 3nm 处理器,NPU 处理速度较 Galaxy Tab S11 Ultra 提升最高 61%,CPU 提升 19%,GPU 提升 17%。
三星发布 Galaxy SmartTag3 追踪器,体积较上代缩小约 35%、重量减轻 33%,首次在 Galaxy SmartTag 系列中支持 Galaxy 与 iOS 跨 OS 兼容。
NVIDIA 介绍如何用 Dynamo-Triton 部署 HSTU 生成式推荐系统。生成式推荐把推荐重构为用户行为序列建模,用户的交互、上下文、候选物品与动作都成为高基数事件流中的 token,而非孤立的召回、排序、预测阶段。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步向开发者、企业和消费者推出。
推荐理由:Gemini 4 Argon 公布输出上限、定价与多项基准成绩,可据此判断前沿模型在长程工程与安全防御上的能力边界。
NVIDIA 发布 cuObject 和 SCADA Server SDK,用于扩展 AI 工作负载对高容量文件与对象存储的快速安全访问。AI 训练、微调、推理上下文、工具调用、搜索和数据库查询等场景对高速数据访问需求日益增长,而这些数据大量存于本地和云端的文件与对象中。
NVIDIA 第 26 届研究生奖学金项目面向全球开放申请,每位学生最高可获 6 万美元资助,申请截止日期为 2026 年 10 月 30 日。该项目面向 AI、机器学习、自动驾驶、计算机图形、机器人、医疗和高性能计算等方向的博士生,要求申请时已完成至少一年博士阶段学习,并须在 2027 年暑期到 NVIDIA 研究办公室完成线下实习。
NVIDIA 发布 NeMo Relay,用于追踪 AI 智能体的执行路径,识别任务虽完成但过程低效的问题,例如失败搜索触发重复搜索、文件读取被截断后命令重复获取相同内容。这些多余步骤会增加延迟和 token 消耗,并提高失败概率。
微软研究院实习生构建的机器学习流水线可提前 30-60 分钟给出美国本土 66,935 座变电站的位置级空间天气风险估计,评估期内检出近 80% 的重大空间天气事件。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文件并返回带引用的答案。
AWS 官方博客给出在 Amazon Bedrock AgentCore Runtime Instances 上部署多智能体音乐制作流水线的完整教程,三个智能体通过同一 runtimeSessionId 共享会话,被调度到同一台 GPU 实例上协作。
推荐理由:完整走通三个智能体在同一 GPU 实例上共享会话协作的部署流程,可迁移到其他长时任务。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:Google DeepMind 把 SynthID 水印扩展到合成生物学,读者可了解 AI 生成蛋白质如何被标记与验证。
CoreWeave 宣布在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,成为较早交付该平台的云厂商之一,Cognition 是首个在 Vera Rubin 上跑生产负载的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 并公布 Devin 实测吞吐数据,可据此判断智能体编码负载的算力走向。
OpenAI 披露其阻断了一次协同的模型蒸馏行动,该行动试图提取受保护的模型推理能力。OpenAI 表示正在加强对对抗性蒸馏的防御。
OpenAI 与美国 SBDC 达成合作,为小企业扩大 AI 实操培训和本地支持,并同步发布一份关于小团队如何使用 AI 的新报告。
Amazon Bedrock 现可通过印度地理跨区域推理,在孟买(ap-south-1)和海得拉巴(ap-south-2)区域调用 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,数据仅在印度境内两个区域间流转。
Amazon Bedrock 现支持在首尔区域使用 Claude Opus 5 和 Claude Sonnet 5、在新加坡区域使用 Claude Sonnet 5 进行区域内推理,请求与数据全程不离开所调用的 Region。
Hugging Face 上线 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重要升级,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。
推荐理由:GPT-6.1 Sol 在 Bedrock 上开放,读者可了解它在智能体编码与文档工作流上的能力定位和成本口径。
NVIDIA 开源了 TensorRT Model Connect,一个基于 TensorRT、用 C++ 编写的 AI 模型参考实现集合,围绕编码智能体设计。项目采用并行开发、模型家族隔离、可回滚变更和 GPU 验证等实践,目标是让 NVIDIA 推理栈的性能更易被使用。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,通过轻量附加网络在不改动基座模型权重的前提下引导生成。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调。
NVIDIA 发布 Metropolis Blueprint for Video Search and Summarization(VSS)3.3,用于降低视觉 AI 智能体的构建与运行成本。该蓝图及其智能体技能把视频接入、流处理、事件检测、检索、摘要与报告整合为可维护的系统,支持在生产规模下理解视频。
Final Cut Camera 发布 2.4 版本,为 iPhone 18 Pro 的 Fusion Main 摄像头带来首次可变光圈控制,并支持快门优先与光圈优先模式。
Apple Creator Studio 将推出全新模板、端到端电影级视频功能与多项提效特性。Freeform 新增自动适配深色模式、文件夹整理看板,并支持 Apple Intelligence 写作工具改写、校对和摘要手写笔记。visionOS 27 中 Freeform 可将图片、视频、便签、形状和 3D 模型拖入空间并成组查看。
Apple 发布一份家庭数字健康指南,围绕屏幕时间对话、儿童账户、网站与应用安全设置、设备使用时间表、通信管理及随孩子成长调整计划六方面给出建议。指南提到 Communication Safety 对所有 18 岁以下用户默认开启,家长可通过 Ask to Buy、Ask to Browse、Time Allowances 和 Schedules 等工具管理孩子的使用体验。
AWS 发布 Amazon Quick 提示词工程基础指南,这是两部分系列的第一篇,聚焦适用于 Quick 各组件(Research、Flows、Sight、Chat Agents、Action Integrations)的通用原则与可复用框架。文章提出 CRISPE 框架,涵盖上下文与约束、角色与职责、意图与输入、步骤与范围等要素,并强调具体化、业务上下文和示例演示能减少迭代、提升首次输出质量。
AWS 发文拆解 Amazon Quick 各组件的提示词写法差异:Quick Research 需明确目标、受众与关注范围,并自行拆解子问题、限定来源(Quick Index。
AWS 发布基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台方案,用 AI 智能体从合同 PDF 中提取八个关键字段并交叉验证,解决 RAG 语义检索无法跨数百份合同做聚合统计的问题。
NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行,无需训练、调参和特征工程,单次前向即可预测新行的分类或回归结果。模型提供 28M 至 215M 三种参数规模,仅用人工合成表格预训练,采用 OpenMDW-1.1 许可可商用,在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。
推荐理由:表格基础模型首次做到免训练免调参单次前向预测,读者可了解其架构设计与基准表现。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与科研人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
Hugging Face 发布论文提出 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,用于识别"跨来源混淆"——即事实在证据池中成立、却被归因到错误来源。
OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、计算机操作和专业工作,具备接近 Astra 的智能水平。其标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,官方给出与 Astra 的定位和价格对比,可据此判断其性价比取向。
OpenAI 发布 DevDay 2026 回顾,汇总超过 20 项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。原文为摘要,未给出各项更新的具体细节。
推荐理由:OpenAI DevDay 2026 一次性放出 20 多项发布,可据此快速了解 GPT-6 Astra、Codex 与 API 的更新范围。
OpenAI 发布 dots,将其定位为可跨复杂项目与日常任务持续工作的主动型助手。官方说明 dots 在推进工作的同时让用户保持控制权。
推荐理由:OpenAI 官方给出 dots 的定位与可控性说明,可据此判断这类主动型助手与现有助手的分工。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度配置,可据此评估长任务智能体的成本与延迟取舍。
微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向推进工作。
Google 与 XPRIZE 合作的 Future Vision XPRIZE 公布大奖得主,独立电影人 Jeff Synthesized 的《The Gifted》从全球 2500 多份投稿中胜出,获得 10 万美元奖金及 250 万美元长片制作资金。
OpenAI 就涉及澳大利亚政府网站的事件致歉,并公布更强保障措施与支持,以加强澳大利亚的网络防御能力。
OpenAI 发布前沿 AI 训练安全案例的早期指南,覆盖技术防护措施、运营实践以及失准事件调查三方面。该指南针对前沿 AI 训练环节,旨在为安全案例的构建提供初步框架。