「多模态物理推理」共找到 3108 篇相关文章
物理-数据双驱动的大迎角非定常气动力建模 | 航空学报CJA
现代飞行器大迎角机动时,气动力复杂,现有建模方法面临两难。论文提出DEM - LSTM混合框架,结合专家经验与数据驱动,解决小样本、强非线性挑战,经算例验证性能优势明显。
全球首个多模态矢量动画生成框架,轻松拿捏跨平台轻量动画
复旦大学等团队推出OmniLottie框架,利用创新分词技术将视频、图文指令变成高质量矢量动画。团队还打造数据集MMLottie - 2M,构建测试基准MMLottie - Bench。实验显示,OmniLottie在多任务测试中优势明显。
用雨伞「钓」无人机?首个针对自主目标跟踪闭环系统的物理攻击
加州大学尔湾分校研究人员用特制雨伞干扰无人机视觉系统,实现FlyTrap攻击,让无人机误判目标远去而失控俯冲。此攻击无需信号干扰,成功率超60%,有强泛化能力,揭示了AI感知系统安全隐患。
CVPR 2026 Workshop征稿|第六届AdvML@CV:多模态大模型智能体安全
IEEE/CVF 计算机视觉与模式识别会议 CVPR 2026 6月3 - 7日在美国丹佛举办,期间6月3或4日将举办第六届对抗机器学习计算机视觉研讨会,聚焦视觉 - 语言智能体安全,现开启论文征稿并公布重要日期,给出投稿入口。
最强开源机器人大脑!蚂蚁两万小时真机数据开启物理AI缩放定律
蚂蚁集团开源具身智能基座模型LingBot-VLA,用两万小时真机数据证明机器人学习有缩放定律且未达瓶颈。该模型优势显著,在多平台表现出色,团队还从数据、架构、工程等方面进行优化,并开源代码等加速行业探索。
攻克长文档与多模态挑战,Paper2Video实现学术视频的自动化生产
新加坡国立大学 Show Lab 团队主导研究,提出 Paper2Video 基准及评价指标,还推出 PaperTalker 多智体框架实现学术视频自动化生产,实验显示其在多方面表现佳,效果接近人工水平。
阿里开源Mobile-Agent-v3:多模态GUI智能体,实现跨平台自动化突破!
全新自动化时代,GUI智能体融入日常。阿里巴巴通义实验室推出GUI - Owl与Mobile - Agent - v3,实现跨平台自动化突破。文章解析其发展历程、技术创新,且项目开源,商业化潜力引关注。
Agentic Deep Research新范式,推理能力再突破,可信度增加,蚂蚁安全团队出品
尽管LLM能力提升,但在复杂任务上受静态内部知识限制。业界提出Agentic Deep Research系统,不过现存系统有梯度冲突和奖励稀疏问题。蚂蚁安全团队提出Atom - Searcher,解决上述问题,实验效果良好。
并行革命,32倍吞吐量跃升!英伟达Helix架构突破百万Token推理瓶颈
英伟达推出受DNA结构启发的Helix并行技术,能解决大模型处理长任务时的卡顿问题,提升上下文长度、并发能力并降低响应延迟。不过也有人认为其技术与实用性有差距。
最强3B「小钢炮」,代码数据全公开!推理随意开关,128k超长上下文
Hugging Face推出30亿参数模型SmolLM3,支持128k长上下文,训练等全链路开放。它在架构、数据混合策略等多方面优化,性能超Llama3.2 - 3B等,还公开双模式指令模型构建方案。