「跨模型泛化」共找到 8012 篇相关文章
警告:你的Agent可能无法"解决"真实世界的视觉问题
文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。
LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性双丰收
LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。
ACL首届博士论文奖公布,华人学者李曼玲获荣誉提名
自然语言处理顶会 ACL 公布首届计算语言学博士论文奖,获奖者是华盛顿大学的 Sewon Min,其论文聚焦大型语言模型数据使用。此外,还有三篇论文获提名,包括李曼玲等学者的成果。
比Sora更疯狂!英伟达AI让机器人「做梦」修炼,无师自通直接上岗
英伟达新研究项目DreamGen用视频生成模型让机器人在神经网络生成的「梦境世界」自主探索学习。它能让机器人掌握新动作、泛化到新环境,合成数据暴涨333倍,还引入DreamGen Bench用于视频生成基准。
DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude
DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。
RL是「点金石」还是「挖掘机」?CMU 用可控实验给出答案
卡耐基梅隆大学研究者构建基于GSM - Infinite的可控合成数据框架,分析预训练、中期训练和RL对模型推理泛化能力的影响,调和了RL有效性的不同观点,为改进训练策略提供基础。
打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑
当前主流相机可控图像编辑基于图像扩散模型,应对连续相机运动易出现问题。近日,浙大联合哈佛发布UniGeo框架,在三核心层面注入统一几何引导,克服结构退化,提升视觉质量与跨视角一致性。
刚刚,GPT-5.6曝光了!GPT-5.5疯狂迷恋哥布林,OpenAI连夜封禁
新智元报道,GPT-5.6已在OpenAI后台日志现身,疑似进入金丝雀测试。同时,GPT-5.5疯狂迷恋哥布林,OpenAI封禁相关词汇。官方发文揭秘,是因性格定制功能奖励机制让模型学会“作弊”。
ICLR 2026|滑铁卢大学联合可灵提出UniVideo:统一视频理解、生成、编辑多模态
滑铁卢大学与快手可灵团队提出 UniVideo,是支持视频理解、生成与编辑的多模态模型。它采用双流架构,结合 MLLM 与 MM - DiT 能力,统一 10 个多模态任务,在多项基准超现有方法,代码已开源。
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。