纯视觉路线」共找到 1054 篇相关文章

算法论文8

Stream-Omni:同时支持各种模态组合交互的文本-视觉-语音多模态大模型

中国科学院计算技术研究所团队提出文本-视觉-语音多模态大模型Stream-Omni,能支持多种模态组合交互。它对各模态关系针对性建模,实现高效灵活的模态对齐,仅用少量语音数据就有多种交互能力。

机器之心
推荐文章7

深度解析世界模型:新范式的路线之争,实时交互与物理仿真

文章认为2026年多模态技术将有大发展,世界模型轮廓渐清。文中对比语言、视频生成模型,指出世界模型优势,分析实时视频与3D结构化两条路线,介绍不同公司产品并以四象限框架分类。

海外独角兽
开源动态8

智谱AI、清华开源新视觉大模型:刷新41项纪录,同级别最强

智谱AI与清华联合开源GLM - 4.5V视觉大模型,它基于GLM - 4.5 - Air开发,架构独特。在42项主流测试中创41项新纪录,多领域表现超Qwen2.5 - VL等模型,还采用新训练策略。

AIGC开放社区
新闻资讯7

特斯拉世界模拟器亮相ICCV!VP亲自解密端到端自动驾驶技术路线

特斯拉世界模拟器在ICCV亮相,可生成自动驾驶挑战场景,对具身智能也有用。其自动驾驶副总裁Ashok Elluswamy称端到端AI是未来,还揭秘技术细节,特斯拉也在解决端到端面临的难题。业界对端到端路线有VLA和世界模型之争。

量子位
算法论文8

哈佛发现基础模型比你想象中更强大:采样方法可超越RL

论文提出基础模型本身已具备强大推理能力,通过“幂采样”采样算法,在多推理任务上媲美或超越RL后训练,挑战“RL才能提升推理”观念,为理解基础模型潜力开新视角。

深度学习自然语言处理
算法论文8

上海交大DENG Lab提出「LatentUM」:Unified Model的真正「战场」在视觉推理与世界模型

上海交通大学 DENG Lab 提出的 LatentUM,尝试让统一模型把生成的视觉内容纳入推理闭环。它在多项任务上超越基线,其核心思路是生成与语言共享语义空间的离散 visual semantic tokens,模型含三大关键设计。

机器之心
算法论文8

英伟达港大联手革新视觉注意力机制!GSPN高分辨率生成加速超84倍

香港大学与英伟达联合推出广义空间传播网络(GSPN)。它采用二维线性传播与“稳定性 - 上下文条件”,将计算量降低,保留图像空间连贯性。在多视觉任务刷新性能纪录,如高分辨率生成加速超84倍。

量子位
新闻资讯7

LeCun离职后不止创一份业!押注与大模型不同的路线,加入硅谷初创董事会

离开Meta后,Yann LeCun创立AMI,还加入Logical Intelligence任技术研究委员会主席。该公司推能量 - 推理模型,与主流大模型路线不同,其Kona模型在数独测试上表现远超大模型。

量子位
新闻资讯8

斯坦福华人天团意外爆冷!AI用CUDA-C编内核,竟干翻PyTorch?

斯坦福华人团队用CUDA - C编写的快速AI生成内核超越PyTorch,成果登上Hacker News热榜。研究者采用KernelBench任务设置,引入新优化方法,实验显示多数最优内核在靠后轮次出现,优化策略集中在几类常见模式。

新智元
算法论文8

让VLM学会「心中有世界」:VAGEN用多轮RL把视觉智能变成「世界模型」推理机器

当前VLM智能体面对复杂视觉任务表现不佳,美国西北大学等机构联合研究成果VAGEN,提出创新强化学习框架,奖励正确思考过程,让VLM在行动前构建内部世界模型,效果超多款闭源大模型。

机器之心