AREX Feed Article
MerchantBench实测:最强LLM Agent电商运营仅达人类27.3%
"27.3%",这个数字给Agent赛道浇了盆冷水
8月5日,一份来自阿里巴巴1688团队的研究论文在AI社区炸开。论文通讯作者为霍成富,第一作者施启明、陶玉龙、金林波等来自1688及合作机构。他们发布的MerchantBench基准测试给出了一个让Agent赛道无法回避的数字:在持续365天的电商店铺运营模拟中,表现最好的LLM Agent配置最终净资产仅为人类参与者的27.3%。
该论文由知名AI研究分享者AK(@_akhaliq,51.6万粉丝)在X平台发布后,12小时内获得8300余次浏览和15次书签收藏。一条高赞回复写道:"27.3% of human net assets over 365 simulated days is a brutal number to put on your own #1 paper of the day"(在自己选的"今日最佳论文"上贴出27.3%这个数字,够狠)。
五个核心结论,每一个都在问同一个问题
论文在48次独立运行(8款LLM × 2种Agent框架 × 3次重复)中交出了几组关键数据。
人类一骑绝尘。三位无电商运营经验的人类参与者平均最终净资产为21.76万元,累计成交9442笔订单,GMV达60.81万元。表现最好的LLM Agent是Qwen3.7-Max搭配Hermes框架,净资产仅为5.95万元,GMV为11.68万元。没有任何模型-框架组合接近人类的净利润水平。
框架增益因模型而异。Hermes框架平均比ReAct框架多产出53.3%的净资产和71.5%的GMV。但这一增益在Kimi K2.6身上反转:它在Hermes下的净资产反而比ReAct低4.1%。框架不是万能药。
稳定性和上限难以兼得。GPT-5.6 Sol在ReAct框架下三次运行的净资产变异系数仅3.3%,稳如磐石。Qwen3.7-Max在Hermes框架下虽然拿到了所有配置中的最高均值,变异系数却高达55.1%。第三次运行的结果远低于前两次。
规则基线不如最差LLM。基于固定规则(每日检查、下架受影响的商品、用日报补坑)的基线策略最终净资产为2.45万元。所有LLM配置均超越了规则基线,说明LLM确实在"做决策"而非随机游走。但距离人类还有一道鸿沟。
活动量不等于产出。论文将工具调用次数和新产品尝试数量与最终净资产做回归,发现两者正相关,但同一活动量水平可以对应相差数倍的净资产。Kimi K2.6在ReAct框架下跑到3004笔订单,但每单净利润仅11.1元。高GMV不等于高净资产。
365天的马拉松:八款模型在两个框架下的完整成绩单
一个从真实数据里长出来的电商世界
MerchantBench的产品目录直接取自1688平台:98,843个真实商品记录,来自36,576家供应商,覆盖服装、家居、电器、宠物园艺、玩具、箱包、运动户外等10个一级品类。需求数据截取自2025年6月1日至2026年5月31日的真实订单轨迹,天然包含618和双11的峰值以及春节谷底。
仿真以小时为粒度推进,365天共8760步。Agent每12步获得一个决策窗口,可调用26个工具完成选品、上架定价、现金流管理和延迟反馈适应。启动资金2000元现金加1000元保证金,50个上架坑位,保证金耗尽则运营终止。
每个订单经历下单、采购、发货、送达、结算的完整生命周期,期间可能触发取消、缺货、延迟发货、仅退款、退货退款、差评等6种异常结果。上游供应商可能调价、下架、延迟发货。订单创建时立即占用现金,但异常可能几天后才浮出水面。这种"即时支出、延迟反馈"的不对称性是MerchantBench区别于此前所有Agent基准的核心设计。
成绩单:没有模型能接近人类
论文评估的8款LLM覆盖了2026年中几乎所有主流前沿模型:GPT-5.6 Sol(OpenAI)、Claude Opus 4.8(Anthropic)、Qwen3.7-Max和Qwen3.7-Plus(阿里通义)、GLM-5.2(智谱Z.ai)、DeepSeek-V4-Pro和DeepSeek-V4-Flash(DeepSeek)、Kimi K2.6(月之暗面)。
在ReAct框架下,GPT-5.6 Sol以4.09万元净资产居首,净利率51.3%;Claude Opus 4.8以3.19万元次之。DeepSeek-V4-Pro仅录得0.66万元。在Hermes框架下,Qwen3.7-Max以5.95万元净资产登顶,GPT-5.6 Sol以5.29万元紧随其后。GLM-5.2和Kimi K2.6倾向于走量,GMV不低(ReAct下分别达6.09万和6.37万),但净利率仅37.3%和32.9%,罚款也更高。
值得玩味的是净利率的分化。GPT-5.6 Sol的51.3%净利率是ReAct框架下的最优值,但它是靠精而非靠量:996笔订单远低于Kimi K2.6的2230笔。人类参与者净利率35.3%,却是在9倍于GPT的GMV规模上实现的。规模和质量,人类两头都占了。
两种崩溃模式拆解:Agent不是不会做,而是做不下去
论文通过逐月追踪Agent行为,识别出两种长期连贯性失败模式。这篇工作中"Long-Term Coherence"(长期连贯性)的概念,很可能成为未来Agent评估的标准维度。
操作连贯性崩溃:Agent慢慢"消失"了。Qwen3.7-Max在Hermes框架下,有效决策窗口率从第一季度的62%跌至第四季度的37%;在ReAct框架下更从68%跌到23%。工具调用量同步锐减。最极端的情况来自Kimi K2.6的一次Hermes运行:Agent在第104天判断"店铺无法恢复",此后剩余523个决策窗口中355个无任何操作。它提前261天放弃了比赛。论文将这种现象命名为"Premature Abandonment"(过早放弃)。人类参与者的有效窗口率始终为100%。
策略连贯性崩溃:Agent在忙,但忙错了方向。Claude Opus 4.8在Hermes的一次运行中做出了一个灾难性推断——"移除弱势商品可以集中流量到留存商品"。它的活跃上架数从第54天的47个一路缩减到第322天的仅剩3个,尽管每个被下架的商品都有独立的需求机会。Qwen3.7-Max在另一次运行中误将第285天记作终止日(实际还有83天),提前停止补货,直到模拟时间越过真正的终点才意识到错误。
人类参与者展示了LLM Agent从未出现的完整反馈闭环:当一款高需求产品频繁触发退货,人类不是简单下架,而是"将该商品从列表中移除,用相近关键词搜索替代品,保留原有需求的同时消除风险来源"。这种"归因、移除、替代"的三步链条,在所有LLM Agent的运行记录中几乎看不到。
这不是Agent的第一个长跑,但可能是最真实的一个
MerchantBench不是孤例。2025年的Vending-Bench测试了自动售货机运营中的长期连贯性,RetailBench聚焦超市管理中96个固定商品。但MerchantBench在三个关键维度上不同。
数据规模碾压前作。98,843个真实商品和365天完整需求轨迹,远超Vending-Bench和RetailBench的合成数据或小规模设定。需求不是静态的:商品随季节和促销周期涨落,Agent必须持续重新配置上架组合。
反馈的混合延迟。上游供应商事件即时可见,下游订单异常延迟暴露。这种时间不对称在此前的Agent基准中不存在。论文用"时间感知选品增益"指标量化了这一点:人类参与者的月度需求匹配分位值从6月的56.1升至12月的80以上,而规则基线始终徘徊在目录中位数附近。
性能衰减可诊断。UltraHorizon和OSWorld 2.0同样报告了Agent在超长视距任务中的衰减,但MerchantBench把衰减拆解为操作连贯性和策略连贯性两个可观测维度,而非笼统的"性能下降"。这使得论文不仅是一份成绩单,更是一套诊断工具。
这份报告之后,三件事可能会发生
第一,Agent评估标准可能从"单任务成功率"转向"长期目标一致性"。现有基准(AgentBench、τ-Bench、WebArena等)衡量的是Agent能否完成有明确终点的一个任务。MerchantBench问的是:Agent能否在持续365天的环境中维持并修正一个商业策略。27.3%这个答案意味着评估维度需要根本性扩展。
第二,Agent架构设计可能从"更强的单步推理"转向"更好的状态追踪与失败恢复"。论文中操作连贯性崩溃的案例说明,问题不在于Agent不会做决策,而在于它逐渐停止做决策。一位社区评论者(@AiGentsy)说得直白:部署答案不是更聪明的模型,而是"bounded authority that expands as the decision history earns it"——权限随累积证据逐步放宽,而非一次性交出全部控制权。
第三,电商和供应链可能成为Agent能力验证的下一个核心场景。1688团队选择电商运营作为测试场景不是偶然。它天然包含资金约束、延迟反馈、动态竞争和持续干预。一个能跑通MerchantBench一半水平的Agent,才谈得上在真实商业场景中辅助人类决策。
参考链接:
- 论文:
- 项目主页:
- 代码:
- @akhaliq 推文: