「多模态物理推理」共找到 3125 篇相关文章
Generalist最新长文定调:具身原生才是正道,中国玩家原力灵机已交卷
Generalist创始人Pete Florence团队释出GEN-1技术博客,否定世界模型与VLA之争,强调具身智能应回归目标,主张从零训练。中国原力灵机DM0也采用具身原生路线,在RoboChallenge评测中成绩优异。
鹏城实验室 X 中大hcp实验室推出 RADAR : 具身智能评测的新标杆
RADAR是鹏城实验室与中大hcp实验室为具身智能领域设计的评测基准,解决现有评测体系三大缺陷,通过创新设计揭示模型不足,为研究者提供方向,推动具身智能实用化。
西门子RXD大会揭秘:AI闯进工厂,胜负手不在算法|甲子光年
西门子于2026年3月23 - 24日召开RXD大会,探讨AI进入生产流程后的挑战与路径。大会指出工业AI落地需软硬协同,西门子依托制造积淀打通全栈技术,还强调开放协作及生态建设的重要性。
超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26
大语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。
刚刚,全球视频模型新王诞生了!
天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。
CVPR 2026 | 还在为AI「鬼画符」发愁?TextPecker即插即用破解文字渲染难题
在生成式AI浪潮中,视觉文本渲染仍是未攻克的核心难题。华中科技大学白翔教授团队等提出TextPecker,是基于结构感知的即插即用型强化学习优化策略,可适配主流生成器,提升视觉文本渲染性能,已被CVPR 2026接收。
GPT-5.4 发布,OpenClaw的能力要被取代?OpenAI 新模型不仅会自己用电脑,编程能力也拉满了
今天 GPT-5.4 发布,整合推理、编程及原生计算机使用能力。其原生电脑操作能力提升,与 OpenClaw 竞争。还带来工具搜索降成本、减少幻觉,编程能力增强但价格也升级。
IC产量增长10.9%、换道超车……今年“两会”的“芯”消息令人振奋
2026年全国“两会”进行中,“政府工作报告”显示2025年科技创新成果丰硕,如集成电路产量增长10.9%。代表委员对半导体等建言聚焦质的飞跃,还给出芯片产业化、算力布局等“解题思路”。
模型砍掉一大半,准确率反升15%!华科&阿里安全新研究实现ViT近乎无损的类特定压缩|ICLR'26
华中科技大学联合阿里安全部提出Vulcan方法,一改传统压缩策略,通过“先训练再剪枝”实现ViT近乎无损的类特定压缩,为大模型服务小场景提供新路径,论文已被ICLR 2026接收。
三星研究院发布手机端侧大模型MeKi:基于Memory的LLM扩展新范式,支持旗舰手机端侧部署
三星研究院发布端侧大模型架构MeKi,提出用存储空间扩展模型容量、提升LLM性能的新范式。它利用手机ROM缓解内存压力,实现容量与性能提升。实验显示其性能、效率表现优,为边缘部署LLM提供新思路。