「自奖励训练」共找到 3107 篇相关文章
AI秒懂短视频,快手大模型Keye-VL理解力爆表!技术细节全开源
快手全新多模态大语言模型Kwai Keye-VL上线且开源,能深度融合多模态信息,在视频理解、复杂视觉感知和逻辑推理上表现优异。介绍了其技术架构、预训练和后训练策略及训练架构优化等内容。
快手在 AI 上,渐入佳境
文章介绍快手多模态大模型 Keye-VL 1.5,参数 8B 适合中小企业。它侧重短视频场景,视频理解能力强,能与业务结合,提升推荐等场景效率。还详述其架构、预训练、后训练及训练架构优化等技术细节。
7B模型“情商”比肩GPT-4o,腾讯突破开放域RL难题,得分直翻5倍
腾讯混元AI数字人团队提出RLVER框架,解决开放域RL在真实交互中的‘情商’优化困境。经其训练的Qwen2.5 - 7B模型在情感对话基准得分跃升,比肩顶级商用模型,团队还有诸多启发性发现。
Claude Managed Agents提了两个新改进,解决企业级安全问题
企业把AI接入内网,认证令牌风险大,阻碍全面接入内部API和数据库。Anthropic为Claude Managed Agents提出自托管沙箱和MCP隧道两个新解法,核心是让凭证控制权留在网络边界,还介绍了相关沙箱服务商。
打造图像编辑领域的ImageNet?苹果用Nano Banana开源了一个超大数据集
苹果研究团队提出Pico - Banana - 400K数据集,基于Nano - Banana在OpenImages实拍照片生成编辑对。其系统化设计保证质量与多样性,还构建自我编辑评估流程,为图像编辑模型训练评测奠定基础。
Agentic Deep Research新范式,推理能力再突破,可信度增加,蚂蚁安全团队出品
尽管LLM能力提升,但在复杂任务上受静态内部知识限制。业界提出Agentic Deep Research系统,不过现存系统有梯度冲突和奖励稀疏问题。蚂蚁安全团队提出Atom - Searcher,解决上述问题,实验效果良好。
端到端GUI智能体首次实现“犯错-反思-修正”闭环,模拟人类认知全过程
南洋理工大学MMLab团队提出框架GUI - Reflection,让端到端多模态GUI智能体有“自我反思”能力。它在各训练阶段引入“反思与纠错”机制,实验证明该框架能提升智能体能力。
世界模型开始做减法?LeCun团队和清华团队给出两种思路
近期,Yann LeCun团队的LeWorldModel用简洁JEPA实现从像素端到端训练世界模型,降复杂度且验证潜在空间物理刻画能力;清华团队的Fast - WAM探讨推理阶段显式生成未来必要性,给出高效替代路径。
LeCun发布最新世界模型:首次实现16秒连贯场景预测,具身智能掌握第一视角!还打脸用了VAE
LeCun团队推出PEVA模型,让具身智能体学会人类“预判能力”,首次实现16秒连贯场景预测。它结合结构化动作表示与条件扩散Transformer,用真实数据训练,解决长时序问题,还能筛选最优动作。
ICLR 2026|在「想象」中进化的机器人:港科大×字节跳动Seed提出WMPO,在世界模型中进行VLA强化学习
香港科技大学 PEI - Lab 与字节跳动 Seed 团队提出 WMPO 新范式,可让具身智能在‘想象中训练’,解决传统 VLA 训练瓶颈,目前论文、代码与模型均已开源。