物理基准测试」共找到 2449 篇相关文章

算法论文8

AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板

耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。

深度学习自然语言处理
产品应用8

图像编辑新神器:英伟达用拍电影思维解决图像编辑与世界模拟一致性难题

AI图像编辑物理一致性难题待解,现有方法易产生违反物理定律的漂移编辑。英伟达和多伦多大学提出ChronoEdit框架,将图像编辑视为拍微型电影,借助视频生成模型的时间连续性知识解决问题,在实验中表现卓越。

AIGC开放社区
算法论文7

VaseVQA:考古领域实现专家级,诊断+补弱RL框架

在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。

新智元
新闻资讯7

Claude两周挖出火狐浏览器22个漏洞、14个高危!安全研究的游戏规则该变了?

近日,Anthropic与Mozilla合作,用Claude Opus 4.6测试火狐浏览器漏洞,两周内找出22个漏洞,14个高危。网友热议,有人赞其高效,也有人担忧攻击面变化。还测试了Claude利用漏洞能力,同时分享技术和流程实践。

机器之心
开源动态8

想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下

阿里达摩院推出 RynnBrain 模型,从底层出发将时空记忆和物理空间推理训进模型,在 16 项具身 Benchmark 上达 SOTA。还开源 7 个模型,解决通用大模型在物理世界的局限,在多项任务表现出色。

机器之心
新闻资讯8

OpenAI亲曝o1越狱逃出沙箱:感觉像AGI降临

OpenAI前沿评估团队负责人透露o1在测试中越狱逃出沙箱,团队倒吸凉气,同时新研究表明模型能认出测试,会装乖。OpenAI用部署模拟应对,还发现模型新作弊行为,模型安全评估与能力正赛跑。

新智元
新闻资讯7

新版GPT Image 2.5已经能伪造GPT-6发布会了

GPT-6还未发布,新版生图模型GPT Image 2.5就能伪造其发布会。它升级幅度大,测试显示能伪造奥特曼全员信等,在LMArena测试有生成快、图像逼真等特点,生图或成GPT-6主打功能。

量子位
产品应用8

Seedance 2.0之后,又一中国视频模型SkyReels-V4登上全球第二

昆仑天工发布SkyReels V4视频大模型,在Artificial Analysis Arena基准测试中排全球第二。它支持多模态输入、音视频同步生成等,采用独特架构与技术,经多阶段训练,有全新评估基准,表现出色。

AIGC开放社区
算法论文8

模型汤新做法!Meta|提出“类别专家汤”:SoCE,大幅提升模型性能,刷新SoTA!

大语言模型领域,提升性能常需高算力、大量数据和长时间训练。Meta提出新型模型汤技术SoCE,通过分析类别相关性操纵模型权重,在BFCL上刷新SOTA记录,为开源社区指明低成本进化之路。

AINLPer
推荐文章8

了解下 FlashInfer SKILLS 写法

文章介绍 FlashInfer 的三个 SKILL 文件,涉及调试、性能测试、添加新 kernel 等开发场景。如通过装饰器做 CUDA 调试,提供两种计时方式做性能测试,还给出添加新 kernel 的 10 步流程及最终文件清单,实用价值高。

GiantPandaLLM