英国 AISI 与 EvalEval 合作开放评测结果,推动基准可复现
英国 AI 安全研究所(AISI)采用 EvalEval 的基础设施公开分享评测结果,发布五个基准(HealthBench、FrontierMath、Humanity's Last Exam。
英国 AI 安全研究所(AISI)采用 EvalEval 的基础设施公开分享评测结果,发布五个基准(HealthBench、FrontierMath、Humanity's Last Exam。
NVIDIA 公布 MLPerf Inference v6.1 结果,Vera Rubin NVL72 首次提交即在 Qwen3-VL 上实现最高 3.7 倍于 GB300 NVL72 的吞吐,在 DeepSeek-R1 上最高 2.5 倍。