「物理推理能力」共找到 4917 篇相关文章
OpenClaw热潮之后,倒计时最后一天 | 线上预约、线下报名
OpenClaw热潮活动倒计时最后一天,由NICE、上海交大人工智能创新协会主办,2026.4.11 14:00 - 17:00举办。多位嘉宾分享,涉及Agent安全防御、智能体身份与通信、大模型进化及个人智能体发展等内容。
告别直接生成,文生图进入Agent时代:港中文联合伯克利开源Gen-Searcher
过去文生图多是‘直接出图’,遇真实世界知识等易翻车。港中文等团队提出Gen - Searcher,让图像生成模型像Agent一样搜索等,数据、模型和代码均已开源,实验显示它提升了生图准确性和质量。
VLA别再「走神」:即插即用提升视觉泛化,相对Pi0.5提升18%
至简动力、北大、港中文团队发现VLA模型深层动作预测对关键视觉区域依赖下降,提出DeepVision - VLA框架,在仿真和真实任务中效果显著,能有效提升视觉泛化能力。
ICLR 2026 | 机器人不够聪明?VLMgineer让大模型自己「发明工具」,从设计到使用全自动
宾夕法尼亚大学研究者提出 VLMgineer,一个全自动工具设计与使用框架,利用视觉语言模型和进化搜索,让机器人自主设计并使用工具。该工作已被 ICLR 2026 接收。实验显示,它在工具设计上优于人类提示和现有 Benchmark 工具。
ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案
多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。
编程 Agent 如何重塑工程、产品和设计
软件公司 EPD 目标是做出好软件,产出为代码。编程 Agent 让写代码变简单,使 EPD 角色定位改变,如 PRD 传统流程终结、瓶颈转向评审、通才更有价值等,各角色需适应新变化。
MiniMax M2.5发布:硬刚 Claude Opus,一美元包断一小时的生产力
MiniMax M2.5发布,硬刚Claude Opus 4.6,以一美元包断一小时的低价降低AI生产力门槛。它在编程、办公等多场景表现出色,速度快且成本低,背后是RL Scaling等技术支撑。
智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析
智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。
如何科学地“设计”SFT 数据?一次关于 ODA 的完整平台级验证
大模型后训练阶段,SFT数据构建常依赖‘直觉’或‘试错’。上海人工智能实验室OpenDataLab团队发布报告,基于OpenDataArena提出新范式,将数据集构建从‘随机艺术’变为‘确定性工程’,并进行平台级验证。
6张图看清中美AI竞赛:美国领先在哪,中国优势在哪
TIME杂志文章用六张图表解析中美AI竞争,指出美国在芯片控制、模型性能和商业变现领先,中国受算力瓶颈制约,但在人才基础和能源供给有优势,特朗普新出口规则或带来转机。