跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 1–10 条 · 共 12 条
9月30日周三
  1. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:Google DeepMind 把 SynthID 水印扩展到合成生物学,读者可了解 AI 生成蛋白质如何被标记与验证。

  2. Simon Willison78

    Anthropic 红队:GLM-5.3 在 4% 试验中实现完整控制流劫持

    Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告称更早的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,认为一个有意义的能力门槛已被跨过。

    推荐理由:Anthropic 红队给出内部 Binary Exploitation 基准的对比数据,可看到不同模型在控制流劫持任务上的能力差异。

9月29日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Kumo Tabular 表格预测基础模型

    NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行,无需训练、调参和特征工程,单次前向即可预测新行的分类或回归结果。模型提供 28M 至 215M 三种参数规模,仅用人工合成表格预训练,采用 OpenMDW-1.1 许可可商用,在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。

    推荐理由:表格基础模型首次做到免训练免调参单次前向预测,读者可了解其架构设计与基准表现。

  2. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与科研人员的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

9月24日周四
9月16日周三
9月8日周二
  1. Google DeepMind80

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单碱基变异预测

    Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模为 1PB,是 AlphaFold Database 的 30 多倍,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。

    推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解基因组变异解读的规模化路径。

9月4日周五
  1. Google Research62

    Google 与 HHMI Janelia 等发布完整雄性果蝇脑图谱

    Google 与 HHMI Janelia 及剑桥大学等合作者在 Cell 发表论文,发布雄性果蝇脑和中枢神经系统的完整连接图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。

    推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 如何加速连接组学重建。

9月3日周四
8月4日周二