英国 AISI 如何用 EvalEval 让基准测试结果可复现
英国 AI Security Institute(AISI)正通过 EvalEval 的 Evaluation Cards 公开分享评测结果,覆盖 HealthBench。
英国 AI Security Institute(AISI)正通过 EvalEval 的 Evaluation Cards 公开分享评测结果,覆盖 HealthBench。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。该版本已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。