CommerceAgentBench: A New Open-Source Benchmark for Real-World Commerce Execution

Accio ·

核心信息

团队开源了 CommerceAgentBench,一个面向真实商业运营的AI基准测试。早期结果显示,最佳整体完成率仅约62%,Qwen 在开源权重模型中表现最强。

要点

  • 大多数AI基准只测试模型“说什么”,但商业场景的难点从来不是答案,而是执行。
  • CommerceAgentBench 专注于真实商业操作流程,现已开源。
  • 早期结果并不亮眼:最佳整体完成率约62%,说明该任务仍有很大挑战。
  • 在复杂商业工作流中,Qwen 是所评估开源权重模型里综合表现最强的。
Loading...