CommerceAgentBench: A New Open-Source Benchmark for Real-World Commerce Execution
核心信息
团队开源了 CommerceAgentBench,一个面向真实商业运营的AI基准测试。早期结果显示,最佳整体完成率仅约62%,Qwen 在开源权重模型中表现最强。
要点
- 大多数AI基准只测试模型“说什么”,但商业场景的难点从来不是答案,而是执行。
- CommerceAgentBench 专注于真实商业操作流程,现已开源。
- 早期结果并不亮眼:最佳整体完成率约62%,说明该任务仍有很大挑战。
- 在复杂商业工作流中,Qwen 是所评估开源权重模型里综合表现最强的。