「多模态扩散模型」共找到 7986 篇相关文章
又一个Kimi K3下周开源!Qwen3.8-Max编程、办公、科研都能自己干了
Qwen3.8-Max是Qwen家族迄今最强模型,2.4万亿参数,下周将开源权重。它在多项基准测试中表现出色,能连续自主工作数天,在编程、办公、科研、长周期任务、多模态等方面全面提升。
10秒视频token超5万,O(n²)跑不动?用后训练线性化框架实现1.71倍加速,推理成本大降|CVPR'2026
视频生成进入大规模时代,但计算成本高,自注意力复杂度O(n²)跑不动。研究团队提出LINVIDEO后训练框架,无需数据和重新预训练,实现视频扩散模型线性化替换,保持生成质量,加速推理并降低成本。
SIGGRAPH Asia 2025|30FPS普通相机恢复200FPS细节,4D重建方案来了
3D视觉领域难题是用普通摄像机将高速世界转为数字化4D时空。受限于成本和带宽,现有方法有局限。本文提出“异步采集 + 视频扩散模型修复”方案,用30 FPS相机恢复100 - 200 FPS动态细节。
摩尔线程天使投资人:对近期AI的四十个观察
摩尔线程天使投资人王捷整理关于AI经济四十个问题,涵盖模型发展、经济影响、就业冲击等方面,如Scaling Law收敛、AI扩散时间、数字层机制等,为探讨AI经济提供观察视角与分析框架。
绝美无痕,比你还会P图的Agent!仅通过自然语言指令,灵活使用数百工具,超越GPT-4o达60%
JarvisArt提出多模态大模型驱动的智能Agent,通过理解自然语言指令,协调200+个Lightroom工具,实现媲美专业修图师的非破坏性编辑。其内容保真度超越GPT - 4o达60%,为AI艺术创作开辟新路径。
DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!
4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。
三维空间太难懂?RoboTracer让机器人理解复杂空间指令,推理3D空间轨迹,开放世界也能精确行动
家庭环境复杂,让机器人理解空间指令难,现有VLM多聚焦2D推理。北航、北大等联合推出多模态大模型RoboTracer,能精准生成3D轨迹,在多项评测中领先,还能直接集成到机器人,完成复杂任务。
Soul App 又又又开源了!这次是实时交互数字人,支持小时级长视频甚至无限时长!
Soul App 新开源实时数字人项目 SoulX-LiveAct,解决 AR 扩散模型流式生成稳定性问题。它实现 20 FPS 实时流式推理,延迟 0.94 秒,支持无限时长,有恒定显存等亮点,可用于多场景。
AI发现医生看不见的隐藏心脏病风险,近90%准确率远超人类专家|Nature子刊
登上《Nature》子刊的研究显示,约翰霍普金斯大学团队开发的多模态AI模型MAARS,用深度学习处理原始MRI图像,实现对心源性猝死风险高精度预测,准确率达89%,还能辅助制定个性化医疗方案。
中美 NeoLab 对话:模型和 Agent 如何实现「持续学习」?
在新加坡 AGI Playground 2026 舞台上,AMI Labs 林敏和 Mind Lab Andrew Chen 深度对谈,探讨 Agent 如何将经验转化为能力、持续学习。两人对持续学习给出不同答案,还讨论记忆、学习等基础问题及解决办法。