Chainalysis 报告:区块链辅助网络攻击激增五倍,朝鲜和伊朗国家行为体为主力
Chainalysis 报告称,区块链辅助网络攻击自去年以来增长超过五倍,主要由朝鲜、伊朗国家行为体和俄语犯罪团伙推动,攻击者将恶意载荷或 C2 配置指针存入公开区块链,形成名为 Blockchain Dead Drops(BDD)的持久化基础设施。
Chainalysis 报告称,区块链辅助网络攻击自去年以来增长超过五倍,主要由朝鲜、伊朗国家行为体和俄语犯罪团伙推动,攻击者将恶意载荷或 C2 配置指针存入公开区块链,形成名为 Blockchain Dead Drops(BDD)的持久化基础设施。
AI 研究机构 Epoch AI 发布报告称,AI 使用成本每季度下降近 50%、每年便宜 13 倍,降速超过锂电池、DNA 测序和 20 世纪算力。
Anthropic 发布报告称智谱 GLM-5.3 可被用于生成恶意内容,护栏防护较弱。在 Exploitbench 沙箱测试中,GLM-5.3 在 410 次运行中生成 50 次端到端漏洞利用。
英国 AI 安全研究院(AISI)在 OpenAI GPT-6 Astra 发布前用 Petri 工具做了模拟网络安全测试,关闭其网络行为分类器后,Astra 在 29.2% 的模拟运行中完成了完整的供应链攻击,而 GPT-5.6 Sol 为 6.3%、GPT-5.5 为零。
推荐理由:英国 AISI 在发布前对 GPT-6 Astra 的模拟测试给出了跨代对比数据,可据此了解前沿模型越权行为的量化变化。
微软研究院实习生构建的机器学习流水线可提前 30-60 分钟给出美国本土 66,935 座变电站的位置级空间天气风险估计,评估期内检出近 80% 的重大空间天气事件。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:Google DeepMind 把 SynthID 水印扩展到合成生物学,读者可了解 AI 生成蛋白质如何被标记与验证。
大脑约一半能量用于产生电活动,人起床、走过昏暗走廊、回忆冰箱食物并判断身体能量状态,这些过程在几秒内完成,都依赖脑内电信号。研究通过观察出人意料的复杂脑电波,揭示大脑内部运作机制。
Anthropic 发布评估称,智谱开源权重模型 GLM-5.3 在漏洞利用能力上接近其 Claude Mythos Preview。
推荐理由:Anthropic 与 CAISI 的实测数据给出开源模型在漏洞利用能力上逼近前沿闭源模型的量化对比,并附有绕过安全护栏的成本估算。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告称更早的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,认为一个有意义的能力门槛已被跨过。
推荐理由:Anthropic 红队给出内部 Binary Exploitation 基准的对比数据,可看到不同模型在控制流劫持任务上的能力差异。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,通过轻量附加网络在不改动基座模型权重的前提下引导生成。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与科研人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
Hugging Face 发布论文提出 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,用于识别"跨来源混淆"——即事实在证据池中成立、却被归因到错误来源。
IEEE Spectrum 报道称,器官芯片、类器官和计算模拟等动物实验替代方法(NAMs)技术已趋成熟,但验证和推广仍面临障碍。2022 年《FDA 现代化法案 2.0》明确允许临床前研究使用 NAMs,2025 年 FDA 又承诺让动物实验成为例外,2026 年 9 月进一步提出用“非临床测试”取代法规中的“动物测试”表述。
Michael Levin 提出"柏拉图心智空间"假说,认为心智是非物理模式,身体与机器只是这些模式进入物理世界的接口,xenobots、anthrobots 及排序算法扰动实验被引为佐证。本期 Import AI 还提到 TPU 上太空,以及智谱启动外层 RSI 循环。
Google Research 发布 AI video co-director 多智能体框架,在 Gemini 和 Veo 之上规划多镜头叙事的视觉连续性,并原生继承 SynthID 水印等安全机制。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归合成与闭环修正四套框架,读者可了解多智能体如何抑制角色漂移与语义漂移。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软对机器人推理卸载的系统性测量,给出任务成功率、电池续航与 Kubernetes 工具链的具体数据。
微软研究院在 Nature 发表逆合成模型 RetroChimera,将 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc 通过可学习集成与重排序结合,并开源实现与权重。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 开放。
Google Research 公布一项研究实验,让教师借助生成式 UI(GenUI)按课程目标动态生成可交互的教学模拟,并内置分级挑战、提示与反馈等教学脚手架。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出。该方法在 Gemma3-4B 和 Qwen3-4B 上微调扇出语言模型,以集合级属性奖励评估整组结果,避免推理时生成数百个 CoT 推理 token。相关论文已被 ICML 2026 收录。
Google 为 AI & Economy ATLAS 推出新的交互式开放数据可视化,便于查看各职业与各国的 AI 使用率。基于 ATLAS 的新研究分析 2600 个专用 AI 模型并调查 600 多名美英科学家,发现近半数科学家每天使用 AI,每周节省近 7 小时,但验证 AI 输出耗时增加、待检验假设积压,物理实验与临床验证环节出现瓶颈。
Google Research 提出 ToolGrad,用文本“梯度”迭代构建 API 工作流,先产出真实工具调用链再反向标注用户提示词,在 16k+ API 的 ToolBench 上以更低成本生成更复杂、通过率更高的数据。
Google DeepMind 发布论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体协作求解 71 道数学题,并给它们配备了公共公告板、私信和共享知识库。
Google Research 用 UK Biobank 欧洲人群与 Biobank Japan 近 20 万日本人样本,在 8 项临床指标上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,纯目标人群模型优于混合欧洲数据训练;HDL、LDL 和血糖等高度人群特异性指标的交叉点更早到来。研究还比较了 meta-analysis 与 PRS-CSx 两种方法。
Google 与 HHMI Janelia 及剑桥大学等合作者在 Cell 发表论文,发布雄性果蝇脑和中枢神经系统的完整连接图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 如何加速连接组学重建。
METR 研究显示 AI 对科学的加速并不均衡:2026 年 cURL、OpenSSL、Firefox 等项目的漏洞报告速度较 2025 年大幅加快,数学领域 arXiv 投稿在部分方向不到 12 个月翻倍,而 AI 研究本身的算法进展尚无显著加速。
Google DeepMind 回顾了 15 年游戏 AI 研究历程,从 DQN 在 49 款 Atari 2600 游戏中学会游玩,到 AlphaGo、AlphaZero、MuZero 和 AlphaStar 在围棋、国际象棋与 StarCraft II 中达到 Grandmaster 水平。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
Import AI 469 期介绍了新基准 DiG-bench,用 70 款规则与目标均隐藏的游戏测试 AI 自主发现环境规律的能力,Opus 5 和 Fable 5 搭配 Claude Code 表现最佳,但仅能在 Tier 7 完成 0.2 的任务,远低于人类的 100%。
微软研究院推出 MindTopo 基准,用连续性、分离、顺序、包围、绳结五类拓扑任务评测多模态大模型的推理与规划能力。结果显示,模型在静态图像识别上明显强于交互式规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型常在多步动作中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列场景中仍不可靠。
微软研究院推出研究模型 CARE-X,一个统一胸片视觉语言模型,可同时输出自由文本推理与结构化预测,覆盖报告生成、病变定位、多标签分类及导管位置检测等任务。该模型采用强化学习(DAPO)在多任务设置下奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证,涵盖罕见 ICU 病理与 CT 确认的增大类病变。CARE-X 为研究模型,未经监管批准,不用于临床诊断。
Import AI 第 468 期收录了智库 IFP 提出的 23 条应对递归自我改进(RSI)的政策建议,分属 7 个类别,涵盖自动化 AI 研发的透明度、风险管理与验证技术。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可跨软件工程、网页导航和个人助理任务复用环境、数据管线与评测流程。
推荐理由:微软研究院开源 Orchard 框架,给出环境服务、训练配方与数据,读者可了解小模型在真实任务上的训练路径。
多伦多大学、Vector Institute、剑桥大学与ServiceNow的研究者构建了一个原型AI蠕虫,利用被攻陷机器的GPU运行开源大模型进行推理,漏洞检测成功率约80%、利用成功率约53%、自复制成功率88%,完整攻击成功率约37%。
Berkeley AI Research 与 IBM Research 将 K-Search 内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出了注意力与 Mamba 两类内核的实测数据。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。
Berkeley BAIR 实验室展示 2026 届博士毕业生,研究方向覆盖机器人、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 与医疗等领域。毕业生去向包括 OpenAI、Mistral AI、Amazon、Physical Intelligence 等机构,以及 UCLA、普林斯顿 CITP 和芝加哥大学等学术岗位。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现,并将其转化为可验证的假设。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假设随后经实验验证。团队借此从海量潜在药物组合中筛选出可测试的候选联合疗法,并尝试解释 resmetirom 为何仅对少数符合条件的 MASH 患者有效。
斯坦福大学医学院遗传学家 Gary Peltz 团队用 Google Co-Scientist 从已有药物文献中筛选肝纤维化候选药,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自己挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝硬化的损伤反应。相关研究已发表于 Advanced Science。