「物理基准测试」共找到 2449 篇相关文章
MIT成果登Nature正刊:90天,「AI科学家」完成3500次电化学测试
美国麻省理工学院李巨团队在Nature发表论文,展示多模态机器人平台CRESt。它结合多模态模型驱动的材料设计与高通量自动化实验,大幅提升催化剂研发速度和质量,还解决了实验结果可重复性不足问题。
720次攻击0成功!Claude Code默认放权,AI替你点「同意」
本周五起,Claude Code在新会话默认让AI替用户点「同意」。其开发者底气源于720次攻击0成功测试。不过业内人士对此不乐观,且测试有局限性,审批权移交AI有风险。
Agent失忆怎么办,Anthropic教你做好工作交接
文章指出AI Agent跨上下文窗口执行长任务时易失败,Anthropic用Opus 4.5实验发现,问题根源是交接差。解决办法是让Agent像人类工程师一样留文档、进度和测试,拆分流程,严格规范,提升测试覆盖率。
全球首个跨本体、跨视角、多模态物理世界模型,CurrentWorld-0 来了!
Current Robotics 发布跨本体、多模态物理世界模型 CurrentWorld-0,它从真实数据学规律,整合跨本体、多视角和力触预测,可评测机器人,解决动作可控性等问题,让评测成训练数据入口。
ICCV 2025 | UniOcc: 自动驾驶占用预测与推理统一数据集及基准平台
来自多所高校团队在ICCV 2025发表统一基准框架UniOcc,融合多源数据,有体素级运动流标注等创新,提出免真值评估指标,支持协同预测,已开源,能推动自动驾驶迈向新阶段。
新型「验证码」诞生?这张图让 ChatGPT、Claude、Gemini 都翻了车
网友用光学错觉图捉弄大模型,人眼秒懂的图案让ChatGPT、Claude、Gemini等翻车。有人认为可作AI检测器,也有人质疑其测试有效性,此外还有其他好玩的小测试。
高潮从第几秒开始?GaMMA 让多模态大模型真正「听懂」音乐时间线
现有多模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。
最强开源机器人大脑!蚂蚁两万小时真机数据开启物理AI缩放定律
蚂蚁集团开源具身智能基座模型LingBot-VLA,用两万小时真机数据证明机器人学习有缩放定律且未达瓶颈。该模型优势显著,在多平台表现出色,团队还从数据、架构、工程等方面进行优化,并开源代码等加速行业探索。
POF | 西北工业大学宋家豪、张伟伟等:一种基于伴随方法的物理信息神经网络预处理框架
物理信息神经网络(PINNs)在正问题中的病态是其应用于复杂工程问题的局限。该研究设计针对损失函数的预处理框架,通过降低PDE系统条件数缓解PINNs病态,还引入伴随方法解决网络参数梯度缺失问题。
Agent全自动搭建代码运行环境,实时更新解决评测过拟合/数据污染问题|微软
长期以来主流代码修复评测基准SWE - bench问题多,制约AI模型能力展现。微软发布SWE - bench - Live,引入新Issue,实现环境自动化构建与更新,打破传统局限,还揭示传统基准过拟合问题。