「评测指标」共找到 874 篇相关文章
Meta全开源HumanCLAW:基础模型正进入具身智能的决策层
过去基础模型主要理解和描述物理世界,如今开始进入机器人控制栈。Meta等提出HumanCLAW,将高层行动与低层运动控制分开。评测显示当前模型在行动决策上存在不足,未来可从多方向推进研究。
都说记忆是Agent标配,但MemSyco发现漏算了一件事
厦门大学与吉林大学的最新研究指出,随着大模型Agent具备长期记忆,虽成为“长期协作者”,但也出现Memory-Induced Sycophancy问题。为此提出MemSyco - Bench评测基准,经实验得出多项发现,指出Agent Memory关键瓶颈转变。
把 AI 邮件工具做到 3500 万美元 ARR,Superhuman:找到 PMF 其实有明确的方法论
文章以 Superhuman 为例,介绍其找到产品与市场契合点(PMF)的方法论。从用户调研、开发模式、找准核心等方面构建 PMF 策略,还阐述衡量及优化 PMF 的方法,如关键指标、四步法等。
全球最大AI榜单塌房!52%高分答案全是胡扯,硅谷大厂集体造假?
2025年底,《LMArena is a cancer on AI》一文引发关注,其指出LMArena这个权威大模型评测平台问题严重。Surge AI调查发现,52%获胜回答事实错误,39%投票结果与事实相悖,Meta还曾为榜单优化模型。
真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge
Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。
开放全栈!超越π0,具身智能基础大模型迎来真·开源,开发者狂喜
继π0后,具身智能基座模型WALL - OSS正式开源,多项指标超越π0。它是通用多模态具身模型,具良好推理和泛化能力。背后自变量机器人刚完成近10亿A + 轮融资,开源将降低具身智能门槛。
让OpenAI只领先5天,百川发布推理新模型,掀翻医疗垂域开源天花板
百川智能发布医疗推理大模型Baichuan - M2 - 32B,在OpenAI的Healthbench评测集上超越刚发布5天的gpt - oss - 120b,领先多数前沿模型,支持RTX4090单卡部署,还首创患者模拟器和Verifier系统。
爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌
腾讯 WorkBuddy 团队将内部模型选型评测等开源成 Benchmark,公开多模型 Agent 工作台选型底牌。Bench 优点是任务分布真实且开源可审计,论文介绍了核心方法论、四大赛道拆解、榜单结果,还对比了现有工作。
老黄开年演讲「含华量」爆表!直接拿DeepSeek、Kimi验货下一代芯片
2026 CES科技盛宴上,老黄PPT燃爆AI圈,DeepSeek与Kimi位列C位。老黄用它们验货下一代芯片,实测显示性能提升显著。中国开源AI表现惊艳,在国际评测中成绩优异,正推动AI应用全面爆发。
看完最新国产AI写的公众号文章,我慌了!
AI 快砸作者饭碗,智谱 GLM - 4.6V 能根据 NeurIPS 2025 最佳论文生成图文并茂的公众号文章。它还能助力学生看论文、分析财报等,可复刻网站、处理视频,在多模态评测中达同级别 SOTA。