返回首页
开源动态8

E - Commerce Bench揭秘大模型网店经营能力

千问大模型
AI 摘要

为评估模型长程经营能力,联合淘天发布E-Commerce Bench。对18个模型评测,各模型结果差异巨大,如GPT - 5.6 Sol资产达143万,Qwen3.5 - Plus只剩1100元。单一指标难反映全貌,评估基准潜力大。

阅读原文 · 千问大模型
大模型开网店,谁是经营高手?E-Commerce Bench开源揭秘
为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。

相关文章