Condé Nast 如何用 Amazon Bedrock 构建多模态视频检索
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
NVIDIA 介绍如何用 Dynamo-Triton 部署 HSTU 生成式推荐系统。生成式推荐把推荐重构为用户行为序列建模,用户的交互、上下文、候选物品与动作都成为高基数事件流中的 token,而非孤立的召回、排序、预测阶段。
NVIDIA 发布 cuObject 和 SCADA Server SDK,用于扩展 AI 工作负载对高容量文件与对象存储的快速安全访问。AI 训练、微调、推理上下文、工具调用、搜索和数据库查询等场景对高速数据访问需求日益增长,而这些数据大量存于本地和云端的文件与对象中。
NVIDIA 发布 NeMo Relay,用于追踪 AI 智能体的执行路径,识别任务虽完成但过程低效的问题,例如失败搜索触发重复搜索、文件读取被截断后命令重复获取相同内容。这些多余步骤会增加延迟和 token 消耗,并提高失败概率。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文件并返回带引用的答案。
AWS 官方博客给出在 Amazon Bedrock AgentCore Runtime Instances 上部署多智能体音乐制作流水线的完整教程,三个智能体通过同一 runtimeSessionId 共享会话,被调度到同一台 GPU 实例上协作。
推荐理由:完整走通三个智能体在同一 GPU 实例上共享会话协作的部署流程,可迁移到其他长时任务。
Amazon Bedrock 现可通过印度地理跨区域推理,在孟买(ap-south-1)和海得拉巴(ap-south-2)区域调用 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,数据仅在印度境内两个区域间流转。
Amazon Bedrock 现支持在首尔区域使用 Claude Opus 5 和 Claude Sonnet 5、在新加坡区域使用 Claude Sonnet 5 进行区域内推理,请求与数据全程不离开所调用的 Region。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的一次重要升级,面向智能体编码、计算机使用和专业工作负载提供更强推理能力。
推荐理由:GPT-6.1 Sol 在 Bedrock 上开放,读者可了解它在智能体编码与文档工作流上的能力定位和成本口径。
NVIDIA 开源了 TensorRT Model Connect,一个基于 TensorRT、用 C++ 编写的 AI 模型参考实现集合,围绕编码智能体设计。项目采用并行开发、模型家族隔离、可回滚变更和 GPU 验证等实践,目标是让 NVIDIA 推理栈的性能更易被使用。
NVIDIA 发布 Metropolis Blueprint for Video Search and Summarization(VSS)3.3,用于降低视觉 AI 智能体的构建与运行成本。该蓝图及其智能体技能把视频接入、流处理、事件检测、检索、摘要与报告整合为可维护的系统,支持在生产规模下理解视频。
AWS 发布 Amazon Quick 提示词工程基础指南,这是两部分系列的第一篇,聚焦适用于 Quick 各组件(Research、Flows、Sight、Chat Agents、Action Integrations)的通用原则与可复用框架。文章提出 CRISPE 框架,涵盖上下文与约束、角色与职责、意图与输入、步骤与范围等要素,并强调具体化、业务上下文和示例演示能减少迭代、提升首次输出质量。
AWS 发文拆解 Amazon Quick 各组件的提示词写法差异:Quick Research 需明确目标、受众与关注范围,并自行拆解子问题、限定来源(Quick Index。
AWS 发布基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台方案,用 AI 智能体从合同 PDF 中提取八个关键字段并交叉验证,解决 RAG 语义检索无法跨数百份合同做聚合统计的问题。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度配置,可据此评估长任务智能体的成本与延迟取舍。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:官方给出了 Sonnet 5.5 在编码与文档任务上的能力变化、与 Opus 5.5 的分工以及 Bedrock 接入方式,便于判断适用场景。
AWS 发布 vLLM-Omni DLC(v1.5),可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出。
在 Amazon SageMaker AI 上,同一 AWS vLLM-Omni DLC 镜像可部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并直接服务企业客户。该中心将与 BMW 合作碰撞仿真与工程 AI、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。Mistral 计划到 2030 年建成 1 吉瓦欧洲算力,其开放权重模型可在客户自有基础设施上运行。
AWS 发布基于 Amazon Nova Act 与 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,用 CloudFormation 和 Terraform 模板把适配器 ID 外置到 Systems Manager Parameter Store,更新生产适配器引用无需重新部署应用,原本数小时到数天的协调缩短到数秒。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B MoE 两个版本,同时推出 Holotron4 Nano。Holo4 可通过 GUI、代码、MCP 和 API 与软件交互,同一模型可运行在桌面、网页、Android、代码沙箱和企业 API 上。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用型 computer-use 智能体的成本与能力边界。
NVIDIA 发布 NVIDIA Open Agent Safety Platform,由开源软件 NVIDIA OpenShell 与 NVIDIA Sentry 参考系统设计组成,覆盖运行智能体的软件、硬件、算力与机器人系统。
推荐理由:NVIDIA 把智能体安全边界从模型层移到运行时与硬件层,读者可据此了解企业级智能体治理的一种新架构。
NVIDIA 发布 OpenShell,为 AI 智能体提供运行时控制能力。该工具面向需要访问工作区、计算资源、数据、凭证和外部服务的智能体,支持其持续数天或数周执行调查软件故障、运行实验等任务。
三星电子作为唯一供应商,联合 SK Telecom 为韩亚金融集团仁川新总部部署私有 5G 网络,建成韩国金融业首个智能办公项目,覆盖总部 16 层、多个集团子公司及数千名员工。方案采用 4.7GHz 中频段、5G Standalone Core 与网络切片,各子公司可使用独立切片,并配备加密、防火墙、DDoS 防护和 USIM 认证等多层安全机制。
NVIDIA DSX MaxLPS 通过策略驱动的电力共享,在参与资源之间动态分配电力,让客户在正常运行时不必为 GPU 峰值功耗预留保护性缓冲。AI 工厂通常按所有 GPU 同时达到峰值功耗的极端情况配置电力,导致大量基础设施在平时处于闲置状态。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码。
AWS 在 Amazon EKS 上结合 EFA 与 DeepEP 优化 MoE 模型的强化学习后训练,实现吞吐量提升 40%。该架构针对 rollout 生成与策略训练并行的异步 RL 负载,缓解 Expert Parallelism 带来的跨节点 all-to-all 通信瓶颈,适用于 RLHF、PPO 和 GRPO 等大规模训练流程。
在 Amazon SageMaker HyperPod 上,用开源 RL 框架 SkyRL 对 Qwen3-VL-8B 视觉语言模型做 GRPO 后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
AWS 的 NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 走并行批处理路径。
阿里云 Qwen 团队的 Qwen3-TTS-12Hz-1.7B-Base 已上架 Amazon SageMaker JumpStart,可部署为全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,为工业气体与焊接分销商提供交互式仪表盘和自然语言查询,业务用户无需再提 IT 工单即可分析租赁数据。TrackAbout 客户合计管理 2750 万件资产、每月处理超 72.5 万张账单,方案通过跨云管道将运营数据定时刷新至 SPICE。
GitHub Copilot 提出聊天并非与 AI 协作的最佳界面,其应用内的 canvas 是可运行完整全栈应用的交互面板,能与 Copilot 智能体双向通信并调用第三方 API、在本地执行代码。文中演示了用 canvas 构建 Connect 4 游戏、Winget 包管理界面和 SQLite 操作界面,并称工作流自动化 canvas 花了大半天才调好设计与自动化。
随着语言模型规模扩大,稠密架构的扩展成本越来越高,因为每个 token 都要经过所有层,训练和推理算力随之上升。MoE 架构改用多个子网络(专家),每个 token 只激活其中一小部分,从而以不同方式实现扩展。
Liquid AI 发布实验性草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,端侧解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。
NVIDIA 指出 GPU 集群即使所有 GPU、网络链路和 pod 均报告健康,512-GPU 训练任务仍可能性能不达标或失败,原因可能是单块 GPU 变慢、链路在负载下降级或配置悄悄将流量导向更慢路径。这类问题往往要到训练运行数小时后才被发现。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。方案是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确算好,评论高度按块懒测量、修正幅度小且锚定在用户当前视口,避免滚动跳变。
NVIDIA 发布 NodeWright,用于管理 Kubernetes 节点本身,覆盖内核设置、系统软件包、存储布局、安全代理以及 GPU 工作负载依赖的主机级调优。该工具针对团队目前依赖 Ansible playbook、自定义脚本和手动 runbook 的做法,这类方式在新区域新建集群或内核升级破坏 RDMA 时容易失效。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软对机器人推理卸载的系统性测量,给出任务成功率、电池续航与 Kubernetes 工具链的具体数据。
NVIDIA 联合 SGLang 团队推出 SWE-Serve,用于评估推理服务软件改动在完整服务路径上的表现,包含 53 个任务。该工具针对 AI 编程智能体的补丁能通过测试、却在服务器加载真实模型并处理请求时失败的问题,检查系统能否通过公开接口返回正确结果。