「科学具身智能」共找到 3963 篇相关文章
比人类专家快2倍,斯坦福联合英伟达发布TTT-Discover:用「测试时强化学习」攻克科学难题
斯坦福与英伟达等机构联合提出 TTT - Discover 方法,让 LLM 在测试时强化学习。它在多任务上成绩出色,如在数学、GPU 内核等领域超越人类和其他 AI,计算成本低,或为持续学习打开新空间。
为防AI刷题,Nature等顶刊最新封面被做成数据集,考验模型科学推理能力|上海交通大学
上海交通大学王德泉教授课题组提出MAC基准,用顶级期刊最新封面构建测试集,评测多模态大模型能力。研究设计两种含“语义陷阱”的测试任务,发现顶尖模型有局限,还提出DAD方法提升表现,采用双重动态机制。
ICCV 2025 | 打造通用工具智能体的基石:北大提出ToolVQA数据集,引领多模态多步推理VQA新范式
北大团队提出ToolVQA数据集,用于提升基础模型工具使用能力。它含2.3万条样本,贴近真实需求。通过ToolEngine构建,涵盖多工具与任务领域。微调后模型表现佳,代码与模型已开源。
5700问答对全面评估拷问AI空间感!最新空间智能评测基准来了丨浙大&成电&港中文
当前视觉语言大模型空间信息学习片段化,缺乏多维度空间推理能力。浙大、成电和港中文团队提出ViewSpatial - Bench基准体系,评估主流模型,揭示其缺陷,并开发MVSM优化跨视角空间理解。
陶哲轩DeepMind梦幻联动,最强通用科学Agent来了!一口气解决芯片设计、矩阵乘法和300年几何难题
谷歌DeepMind与陶哲轩等打造的AlphaEvolve是LLM驱动的进化编码Agent。它能优化计算生态、调度数据中心等,还解决了数学难题,已在谷歌内部使用,现开启早期邀测试用。
AI让科研人发了3倍论文,但科学本身正在收缩:什么才是科研人真正需要的AI?
2026 年研究显示,用 AI 工具的科学家发文量是不用者 3.02 倍,但科研主题覆盖面缩减、虚假引用增多。通用 AI 提升效率却动摇科研基础,爱思唯尔 LeapSpace 注重可信度与发现力,已开放免费试用。
独家丨擎天租完成A轮及A+轮数亿元融资,估值达70亿元,具身赛道再添独角兽
AI 科技评论独家获悉,擎天租完成 A 轮及 A+ 轮数亿元融资,估值达 70 亿成独角兽。其定位 RaaS 平台,将业务重心推向产业场景,本轮融资用于体系建设和场景拓展。
直面LeCun愿景,智在无界发布最强具身世界模型,20万小时人类视频屠榜6大榜单
智在无界作为人类视频学习路线开创者,4月14日发布第三代旗舰模型Being - H0.7,用20万小时人类视频训练,提出新范式,在6项权威评测中综合排名全球第一,拓展了世界模型能力边界。
ICML 2025 | 给AI装上「智能升级插件」!阿里安全-清华大学D-MoLE让模型在持续学习中动态进化
近日,阿里巴巴集团安全部 - 交互内容安全团队与清华大学联合研究成果被 ICML 2025 收录。他们提出 D - MoLE 框架应对多模态大模型持续学习挑战,实验显示其性能优、训练快,还能用于提升阿里安全审核模型适应力。
首个智能体商业信任协议来了!支付宝携手千问 App、淘宝闪购等发布 AI 商业协议 ACT
1 月 16 日,支付宝联合千问 App 等伙伴发布 ACT 协议,它是中国首个面向 Agent 商业需求的开放技术协议。该协议打造 AI 与服务平台‘通用语言’,解决授权、安全等问题,让操作更放心,还降低商家对接成本。