算法论文8
李飞飞团队:大模型物理推理能力不及格
AIGC开放社区
AI 摘要
李飞飞团队推出QuantiPhy基准测试视觉语言模型物理推理能力。测试显示,顶尖模型数值计算不如人类,推理靠记忆而非测量,指示未来AI应学会基于视觉与物理约束推理。
阅读原文 · AIGC开放社区
世界首个!李飞飞团队推出物理推理基准,大模型统统不及格?
斯坦福联合中科大团队推出世界首个评估视觉语言模型物理推理能力的基准QuantiPhy,通过测试发现顶尖模型在数值计算上不如人类,还揭示模型推理靠记忆而非测量,为AI发展指明方向。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
鹿明发布NexCore助力具身智能落地
8月19日鹿明机器人发布具身智能进化引擎Lumos NexCore,试图在数据、模型等与机器人间建立生产与运行链路,让机器人能力成可复用‘技能资产’,解决具身智能技能生产效率问题。
机器之心
新闻资讯8
王兴兴:宇树上市,“非共识”创业路迎挑战
2026年宇树科技成功上市,创始人王兴兴创业十年有诸多“非共识”观点。如高性能机器人不意味昂贵,堆数据难带来具身智能,AI强对硬件要求或降低。如今宇树成行业共识,也面临新挑战。
甲子光年
产品应用7
墨奇:Agentic - Native解具身智能长程执行难题
具身智能中长程执行成关键问题,墨奇智能发布具身模型架构MoRA,提出Agentic - Native技术路线,让Agentic能力原生存在于策略模型中,还介绍了模型内部设计、所需数据等内容。
甲子光年
新闻资讯7
Anthropic营收反超OpenAI,IPO占优
IPO前夕,Anthropic最新年化营收达650亿美元,8个月翻超7倍,反超OpenAI。双方在资本市场竞争激烈,A社在起跑时间、财务、商业模式上占优,但OpenAI用户规模和产品生态占优,目前A社牌面更好。
量子位