奖励设计」共找到 1506 篇相关文章

算法论文8

VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应

多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。

机器之心
开源动态7

从组件到 OS 的跃迁,MemOS 深度拆解:构建企业级 Agent 的高性能记忆底座【上】

本文深入剖析开源记忆方案MemOS,它将记忆从“外挂组件”升为“系统资源”。介绍其设计理念、核心架构,分析记忆需加工、分层调度和治理的原因,还阐述记忆三态及流转,最后展示MemOS Cloud的使用方法。

AI大模型应用实践
算法论文8

腾讯提出Vision-SR1:让模型真正学会“看图思考”,而不是“蒙答案”

视觉语言模型(VLMs)存在视觉幻觉和语言捷径问题,限制其可靠性和泛化能力。腾讯提出Vision - SR1训练方法,通过推理分解和自我奖励机制,不依赖外部监督,提升模型视觉感知和推理可靠性。

深度学习自然语言处理
算法论文8

116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了

一篇前沿大模型安全漏洞论文引发热议,指出各大模型 API 设计缺陷,可提取隐藏思维链。同一模型家族安全能力不对称,攻击者可利用此漏洞,还介绍了攻击路径、实验及修复建议。

机器之心
开源动态8

Karpathy强推,大厂抢着「复古」命令行,Star数全都上千了

飞书、钉钉、企业微信接连推出 CLI,GitHub Star 数上千。CLI 是传统人机交互方式,契合大语言模型运作逻辑,国内外多家公司及项目推出相关工具,还给出为智能体构建 CLI 的设计模式。

机器之心
算法论文8

大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026

阿里巴巴未来生活实验室团队解决多模态大模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA。

量子位
算法论文7

视频模型假装在推理?MME-CoF新基准评估12个推理维度

视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。

新智元
算法论文8

DeepMind再登Nature:AI Agent造出了最强RL算法!

Google DeepMind团队提出DiscoRL,让智能体在多环境交互中自主发现强化学习规则,无需人类设计。它在Atari基准中击败MuZero,在未见过的游戏中也稳定高效,相关研究登《Nature》。

新智元
新闻资讯8

英伟达下一代GPU登场,Rubin CPX一次推理数百万Token,网友:这是头野兽

在周二的AI基础设施峰会上,英伟达宣布推出专为超100万token长上下文推理设计的Rubin CPX GPU。它将与其他产品组成新平台,性能卓越,还能复用现有平台,预计2026年底上市。

机器之心
新闻资讯8

苹果OS全家桶12年最狠升级!AI入侵一切,唯独Siri没更

春季WWDC开幕,苹果OS全家桶迎十多年最大版本升级,统称OS 26。苹果AI进化,支持实时翻译、看屏搜物等。开发者工具升级,三行代码可调用苹果AI。各系统在设计、功能上均有革新。

新智元