Hugging Face 推出 Open TTS Leaderboard:面向多语言 TTS 与声音克隆的可扩展评测
Hugging Face 上线 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Hugging Face 上线 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行,无需训练、调参和特征工程,单次前向即可预测新行的分类或回归结果。模型提供 28M 至 215M 三种参数规模,仅用人工合成表格预训练,采用 OpenMDW-1.1 许可可商用,在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准上排名第一。
推荐理由:表格基础模型首次做到免训练免调参单次前向预测,读者可了解其架构设计与基准表现。
Hugging Face 发布论文提出 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,用于识别"跨来源混淆"——即事实在证据池中成立、却被归因到错误来源。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B MoE 两个版本,同时推出 Holotron4 Nano。Holo4 可通过 GUI、代码、MCP 和 API 与软件交互,同一模型可运行在桌面、网页、Android、代码沙箱和企业 API 上。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用型 computer-use 智能体的成本与能力边界。
NVIDIA 发布 NVIDIA Open Agent Safety Platform,由开源软件 NVIDIA OpenShell 与 NVIDIA Sentry 参考系统设计组成,覆盖运行智能体的软件、硬件、算力与机器人系统。
推荐理由:NVIDIA 把智能体安全边界从模型层移到运行时与硬件层,读者可据此了解企业级智能体治理的一种新架构。
Liquid AI 发布实验性草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,端侧解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。
Hugging Face 在 transformers 中加入 GGUF 模型支持,用户可从 Hub 选取量化 checkpoint,通过 from_pretrained 传入 gguf_file 在本地生成,也可用 transformers serve 暴露 OpenAI 兼容 API。
推荐理由:Hugging Face 官方说明 transformers 如何直接加载 GGUF 量化权重,并给出与 llama.cpp 的实测对比和当前限制。
oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 生态建设。oMLX 将从副业转为有资金支持的长期项目,继续以 Apache 2.0 开源并由 Jun 继续主导,目标是让贡献者获得更稳定的维护和更快的开发节奏。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:Gemma 4 家族新增文本扩散实验模型,读者可据此了解本地低并发推理的加速路径与质量取舍。