跳到正文
原文
Hugging Face Blog·· 14 天前精选AI 评分62

IBM 研究提出 Consistency Analyzer,将智能体重复执行一致性差距减半

Your Agent Aced the Task. Will It Do It Again?

AI 导读

IBM Research 发布技术报告,指出平均准确率掩盖了智能体的不可靠问题:ReAct 智能体(GPT-4.1 在 AppWorld 上)平均成功率 77.4%,但全部 5 次重复运行都成功的任务仅占 53.0%,一致性差距达 24.4 个百分点。

推荐理由

原文用具体数据说明平均准确率掩盖了智能体重复执行的不稳定问题,并给出可复现的诊断与改进方法。

来源:Hugging Face Blog · huggingface.co