「多模态物理推理」共找到 3103 篇相关文章
对话上交大程远:AI的终局不在云端,而在“感算一体”的物理世界
文章围绕端侧 AI 展开,以上海交通大学程远研究为例,探讨其技术方向“感算一体”,还提及 Agentic AI 热潮,对比其与大模型热区别,阐述端侧与云端关系,及光计算等底层硬件创新对智能设备的影响。
原生理解生成统一:商汤开源SenseNova U1,用统一架构终结「缝合怪」多模态
商汤开源日日新 SenseNova U1 系列原生理解生成统一模型,采用 NEO-unify 架构,只需 8B 小参数就能实现很多商业闭源模型效果。在多测评维度性能领先,还能实现连续性图文创作输出,解决理解与生成断层问题。
迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合的巨大待探索空间
大模型常采用RAG技术,多模态崛起使RAG向MM - RAG发展。目前MM - RAG研究初级,华中科技大学等研究者发布综述,覆盖所有模态组合,剖析工作流,提供构建系统的一站式指南。
突破Agent长程推理效率瓶颈!MIT&新加坡国立联合推出强化学习新训练方法
AI Agent处理复杂任务时显存、算力问题凸显,MIT和新加坡国立大学联合提出MEM1框架。它基于强化学习,让智能体学会管理记忆,实现近似常量级显存开销,在多方面表现超越大模型。
刷新复杂Agent推理记录!阿里通义开源网络智能体超越DeepSeek R1,Grok-3
互联网信息检索中,复杂问题让普通开源模型力不从心。阿里通义实验室提出WebSailor方案,通过SailorFog - QA数据集和DUPO算法等创新,提升模型能力,在多基准测试中超越诸多开闭源模型。
Gemini准确率从21%飙到97%!谷歌只用了这一招:复制粘贴
Google Research研究发现,将输入问题复制粘贴一遍,能让大模型在非推理任务上准确率惊人提升,如Gemini 2.0 Flash - Lite从21.33%升至97.33%,且几乎不影响生成速度,但不适用于推理场景。
林俊旸离职后首次发声!复盘千问的弯路,指出AI的新路
林俊旸离职阿里千问后发声,反思千问技术路线,认为千问合并两种模式未做好。他指出推理时代已过,未来是智能体时代,智能体思考将成主流,还阐述了其与推理思考区别及面临的挑战。
推理时间减少70%!前馈3DGS「压缩神器」来了,浙大Monash联合出品
在AR、VR等领域,3DGS是新视角合成(NVS)领域备受关注的技术方案。现有前馈3DGS模型存在编码器容量有限等问题,ZIP Lab和Monash团队引入信息瓶颈原理,推出轻量级模块ZPressor,有效解决信息过载难题。
多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开
上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。
八年研究沉淀,原方智能试图让机器拥有关于世界的「信念」
原方智能正式启动,由林浩鑫与唐开强创立,技术源于 LAMDA 团队八年研究。其目标是使机器在物理世界形成对世界的'信念',以世界模型为核心技术路线,将研究成果推向开放物理世界。