新闻资讯7
全球最大AI榜单被指造假,评测变“选美”
新智元
AI 摘要
AI界权威评测平台LMArena被指问题严重,Surge AI调查显示超半数最佳答案错误,Meta曾为冲榜优化模型。该平台依赖志愿者投票,缺乏质量控制,开发者面临为流量或实用性优化的抉择。
阅读原文 · 新智元
全球最大AI榜单塌房!52%高分答案全是胡扯,硅谷大厂集体造假?
2025年底,《LMArena is a cancer on AI》一文引发关注,其指出LMArena这个权威大模型评测平台问题严重。Surge AI调查发现,52%获胜回答事实错误,39%投票结果与事实相悖,Meta还曾为榜单优化模型。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Meta推出Hatch,模型切换引关注
Meta推出智能体平台Hatch,功能类似Manus,开发阶段用Claude,计划正式上线时切换到自研模型Muse Spark,10月推出新模型Watermelon。Hatch注重消费数字生活,与Meta社交生态深度绑定,高端订阅有默认分发优势,但面临真实环境考验。
量子位
推荐文章8
前英伟达工程师:AI 终局是后台 Agent
前英伟达工程师、Sail Research 创始人 Neil Movva 认为当前 AI 行业陷“延迟陷阱”,AI 终局应是后台 Agent。他执行“算力拾荒者战略”,想降低智能成本,还指出 Transformer 架构有缺陷,互联网数据被吃光等问题。
AI科技大本营
新闻资讯8
比尔·盖茨:AI已跨过临界点引担忧
比尔·盖茨在与《麻省理工科技评论》的采访中表示,AI在多方面已跨过临界点,但行业外缺乏讨论。他警告生物恐怖主义风险,提出‘人类保留岗位’、征税等政策设想,也看好AI在部分领域价值。
DeepTech深科技
产品应用7
HarmonyOS腕上健康应用:机遇与鸿沟并存
文章聚焦HarmonyOS穿戴应用,如「小卡健康」将健康记录入口移到手表,还介绍「开练」「凯格尔运动」应用。阐述了从接口到产品需解决权限、断连等问题,强调要为用户提供合适体验。
AI前线