视觉语言理解」共找到 2156 篇相关文章

算法论文8

复旦、同济和港中文等重磅发布:强化学习在大语言模型全周期的全面综述

来自多所顶尖科研机构的研究者完成长文综述,总结大语言模型全生命周期的强化学习研究,阐述其各阶段应用策略,分析未来挑战与趋势,重点关注 RLVR 技术,有全生命周期梳理等三大贡献。

机器之心
开源动态8

MiniMax开源首个视觉RL统一框架,闫俊杰领衔!推理感知两手抓,性能横扫MEGA-Bench

MiniMax开源首个视觉RL统一框架V-Triune,由闫俊杰领衔。该框架通过三层组件设计和动态IoU奖励机制,让VLM能联合学习推理和感知任务。还开发Orsta模型系列,在MEGA - Bench表现出色,且MiniMax多模态布局动作多。

量子位
产品应用8

美团提出全新多模态统一大模型STAR,GenEval突破0.91,破解“理解-生成”零和困局

近日美团推出多模态统一大模型 STAR,以“堆叠自回归架构 + 任务递进训练”实现理解与生成双重突破。它解决行业痛点,通过三大核心设计统一能力,实验在多任务中表现顶尖,还给出后续探索方向。

机器之心
算法论文8

ICML 2025|多模态理解与生成最新进展:港科联合SnapResearch发布ThinkDiff,为扩散模型装上大脑

现有扩散模型缺乏多模态推理创作能力,在算力和数据不充裕时实现该功能是难题。ICML2025上,港科联合SnapResearch提出ThinkDiff,以较少资源让扩散模型有思考能力,开辟多模态理解生成新路径。

机器之心
推荐文章8

李飞飞终于把空间智能讲明白了:AI 的极限不是语言,世界远比文字更广阔!

李飞飞在人工智能聚焦语言模型时关注空间智能。她指出当前AI局限,亲自撰文阐述构想。构建具空间智能的世界模型挑战大,但应用潜力大,如创意、机器人、科研医疗教育等领域,能赋能人类。

AI科技大本营
开源动态8

更大,还能更快,更准!蚂蚁开源万亿参数语言模型Ling-1T,刷新多项SOTA

10月9日,蚂蚁开源万亿参数语言模型Ling-1T。它延续自研高效MoE架构,在编程、数学推理等多维度测试表现亮眼,还能兼顾精确与效率。此外,它在多场景实用性强,其创新设计提升了能效比与性能。

机器之心
开源动态8

带图推理碾压同类开源模型!港中文微软等开源OpenThinkIMG框架,教AI学会使用视觉工具

港中文、微软等联合推出OpenThinkIMG开源框架,解决AI使用视觉工具面临的集成难、缺数据、适应差等问题,还公开核心技术V - ToolRL。该框架在图表推理任务上表现超GPT - 4.1,为下一代AI智能体提供基础。

量子位
开源动态8

「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?新基准来了

近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。

量子位
算法论文7

60%情况下,主流大模型没理解风险只是装懂!别被模型的“安全答案”骗了

研究发现超60%案例中主流推理模型生成合规答案却未真正理解风险,存在系统性漏洞。淘天集团团队引入“表面安全对齐”术语,推出Benchmark研究该现象,还介绍了数据集生成流程及评测指标。

量子位
算法论文8

AI一眼认出95万物种,还能分辨雄雌老幼,2亿生物图像炼成“生命视觉”大模型

俄亥俄州立大学团队用2亿生物图像训练BioCLIP 2模型,取得最优物种识别性能。它在无相应监督信号的非物种任务中,准确率远超DINOv2,还涌现出物种间生态对齐、物种内差异分离等生物学理解

量子位