跳到正文
9月21日周一
  1. Import AI22

    Import AI 473:美国超级智能战略、人脑组织小鼠实验与机器诠释学

    RAND 发布报告提出美国应以“自由行动”战略应对通往超级智能的不确定路径,通过保持选项开放来确保地缘政治优势,并归纳了共存、拒止、加速三大类共七种原型策略及五项关键不确定性。研究人员还培育出脑内含有部分人脑组织的小鼠,用于相关实验。

9月18日周五
9月17日周四
9月15日周二
9月10日周四
9月9日周三
9月8日周二
9月7日周一
9月3日周四
  1. Google DeepMind62

    Google DeepMind 推出 Fairwind Program,向政府与企业开放 Gemini 3.8 Flash Cyber

    Google DeepMind 推出 Fairwind Program,面向政府机构、关键基础设施运营商和网络安全合作伙伴提供受限访问,首批开放其最先进的网络安全模型 Gemini 3.8 Flash Cyber 与 CodeMender 工具链,用于自主发现、验证并修复漏洞。

    推荐理由:原文给出受限访问计划的能力组合与准入标准,读者可据此判断前沿模型在漏洞修复上的落地方式。

  2. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和面向网络安全的 Gemini 3.8 Flash Cyber,前者在软件工程、智能体任务和多步推理上较 3.7 Flash 明显提升,价格保持每百万输入 token 0.75 美元、输出 token 3.75 美元。

    推荐理由:Gemini 3.8 Flash 在编码与智能体任务上接近更贵的前沿模型,同时保持 3.7 Flash 的价格,可据此判断性价比取舍。

9月2日周三
  1. Google AI Blog62

    Google 推出 Fairwind Program,向政府与企业提供 Gemini 3.8 Flash Cyber 网络防御能力

    Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 模型与 CodeMender harness,用于自主发现、验证并修复漏洞。

    推荐理由:原文给出受限访问计划的能力组合与准入标准,读者可据此判断前沿模型在漏洞修复上的落地方式。

8月31日周一
8月27日周四
  1. Google DeepMind58

    Google DeepMind 试点全球首个双盲 AI 评测

    Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在密码学隔离环境中,避免模型提前接触测试题目。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite,以提升评测可信度。

8月10日周一
8月3日周一
7月17日周五
7月16日周四
6月25日周四
6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap,为智能体部署加装系统级安全层

    Google DeepMind 发布 AI Control Roadmap,提出在模型对齐之外增加系统级安全层,把内部智能体当作潜在未对齐对象来管理。该框架借鉴 MITRE ATT&CK 做 AI 威胁建模,用可信 AI 作为监督者审查智能体的推理与行动,并以覆盖率、召回率和响应时间三项指标衡量监控效果。

    推荐理由:Google DeepMind 公开内部 AI Control 路线图,给出威胁建模、监控指标与分级响应框架,可了解大厂如何为智能体部署加一层系统级安全。

6月10日周三
5月16日周六
  1. Google DeepMind36

    Google DeepMind 与新加坡达成国家 AI 合作,落地医疗、教育与气候项目

    Google DeepMind 与新加坡政府启动国家 AI 合作,在新加坡推出医疗、科研、教育和气候等领域的新项目。合作探索 AI co-clinician 辅助诊疗,并用 AlphaFold、Google Earth 等工具推进东南亚传染病与疫情防控研究,同时向中小学至初级学院全体教育者提供 Gemini for Education。

3月13日周五
  1. Berkeley AI Research36

    Berkeley AI Research 提出 SPEX 与 ProxySPEX:大规模识别 LLM 关键交互

    Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等方法。