Mistral AI 发布开源编码智能体 Devstral,SWE-Bench Verified 得分 46.8%
Mistral AI 与 All Hands AI 合作推出面向软件工程任务的智能体大模型 Devstral,在 SWE-Bench Verified 上取得 46.8% 的得分,超过此前开源 SoTA 模型 6 个百分点以上,并超越 DeepSeek-V3-0324 和 Qwen3 232B-A22B 等更大模型。
推荐理由:原文给出了 Devstral 在 SWE-Bench Verified 上的得分和与闭源模型的对比,读者可以据此判断开源编码智能体的当前水平。