跳到正文
原文
Hugging Face Blog·· 2026-09-02AI 评分32

Hugging Face 推出 BenchMIRT:审计 LLM 基准到底在测什么

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

Hugging Face 发布 BenchMIRT,用多维项目反应理论(MIRT)在单条提示词层面审计 LLM 基准,基于 100 个 LLM、16 个基准、超 34K 道题训练,在未被告知基准对应能力的情况下自行恢复出安全与通用推理两个主导维度。

来源:Hugging Face Blog · huggingface.co