上周一,我发布了关于AIHOT大模型的排名,引起了众多好友的关注,其中一条评论获得了最好评,询问是否能进行分类评测,以便评估不同模型在特定任务下的表现。老实说,这一直是我希望实现的目标,也是一个极其核心的痛点。目前存在许多大模型榜单,比如LiveBench和DeepSWE等,这些榜单可以快速了解各个模型在某些能力维度上的强弱,比如编程、数学和浏览器操作等。然而,最稀缺的评测类型是模型在真实工作场景中的表现。例如,金融、法律、电商、以及日常生活等领域,如果能够给模型提供一份真实的工作,让其自主完成,并评价最终效果,这才是最能反映用户的实际需求和使用体验的。因此,我一直希望在分类中增加这类场景,以丰富排行榜的多维度。这个周末,我查阅了几乎所有的评测集,结果发现这方面的评测集确实少得可怜,数量可以用寥寥无几来形容。而且,绝大多数模型在这些实际任务上的成功率也非常低,和它们在编程领域的表现截然不同。我举个例子,使用一个相对成熟的电商评测集——RealReplicaBench,这个新近开源的评测集来自阿里国际站,主要针对外贸,所以数据的权威性可信性相对较高。这个评测集涵盖107个任务,阿里国际站根据160万条完整对话收集了20万条工作流,并归纳出约2000条商业价值较高的,最后整理成这107个任务,这些任务几乎覆盖了电商领域的所有工作场景,包括供应商采购、商品发布、店铺经营、订单对账、国际物流及售后争议等。我让GPT制作了一张图表,便于大家可视化每个任务的分布情况。这些任务真实反映了电商业务中的多样性。例如,有任务要求模型上线一款定制的瑜伽垫,提供信息包括发品计划、三家供应商的报价以及实拍图片。模型需从中识别出指定供应商,填写类目、销售国家、定价和描述,并从一系列编号的照片中找出清晰的商品图上传。另一个任务要求模型为从东莞到达拉斯的消费级电子产品规划运输路线,在30天内计算保险、清关和其他费用,以找到最低成本的运输方案,还需要在仿真的货代平台上完成货物的订舱和验证。此外,还有针对电商退货争议的处理任务,模型需综合考虑订单记录、物流信息、仓库检验、客户沟通、现场照片、平台政策和截止时间,逐单作出是否接受退货、退款或申诉的决定。甚至任务里还有跨平台的月度对账需求,模型需要将天猫、京东、拼多多三者的订单格式统一,检查发货与结算之间的差异,并计算各个SKU的收入与利润,最后提供格式化报告。从这些例子可以看出,几乎所有的任务都是现实电商交易中真实的业务需求,但理论上,这些复杂且琐碎的工作理应由AI代理来处理。然而,当我们想看看那些在编程领域似乎无所不能的模型在这些真实任务中的成功率时,我们会发现情况并不乐观。这些模型是在开源的PI框架下进行测试的,因此其准确性没有问题。在107个任务中,只有Claude Opus 5勉强通过了及格线,完成了65个任务,成功率为60.75%。而名列第三的Qwen 3.8 Max与DeepSeek V4 Pro的通过率仅为49.53%。也就是说,目前大多数模型在真实场景下的成功率甚至连50%都达不到,这些模型在107个任务中,一半的任务完全无法完成,这真实反映了当前模型在实际工作中的尴尬现状。我深入研究了他们如何衡量模型的完成情况和评分标准,发现这个过程比我想象得要复杂得多。以一个供应商采购任务为例,主角Dana是一名采购经理,假期归来时在邮箱中看到近300封邮件,但她有一个铝合金笔记本支架的项目必须当天推进。模型需要从这些邮件中提取出与项目相关的需求、最新规格和数量,并且从20家供应商中筛选出合格且成本最低的供应商,接下来还需进行一系列标准化的操作。
2026-08-19
2026-08-19