人类反馈强化学习」共找到 1976 篇相关文章

算法论文8

挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2

南京大学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨大鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。

机器之心
新闻资讯7

成立7个月首发声!百亿美金独角兽万字雄文:攻克LLM推理非确定性难题

估值120亿美元的Thinking Machines Lab成立7个月首次公开研究成果,揭示LLM推理非确定性的真凶是kernel缺乏批处理不变性。介绍了实现批处理不变性的方法,还通过实验展示其效果及对同策略强化学习的意义。

新智元
算法论文8

ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力

最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。

机器之心
开源动态8

开源模型首次物理奥赛IPhO夺金!上海AI Lab 235B模型击败GPT-5和Grok-4

上海AI Lab的P1 - 235B - A22B在国际物理奥林匹克竞赛夺金,在HiPhO基准测试获12金1银,超越GPT - 5等闭源模型。团队构建HiPhO基准测试,用多阶段强化学习训练模型,开发PhysicsMinions系统提升推理能力。

量子位
开源动态7

原力灵机发布Realtime-VLA V2:从遥操作到真实部署,VLA提速的系统解法

原力灵机发布《Realtime - VLA V2》技术报告,在VLA控制下让机器人快速运动。实现数倍于遥操作采集训练数据的速度执行VLA,解决了遥操作数据采集、时序延迟等问题,还通过“油门式采集”提升速度,但离人类性能仍有差距。

AI科技大本营
新闻资讯8

11 年前的那张图,又火了

一张2015年关于AI的智能曲线图近日在X上刷屏,马斯克也进行了转发。该图作者Tim Urban将AI分为ANI、AGI、ASI三个层级,指出人类习惯线性思考,但AI进步是指数级的。如今AI发展加速,其能力边界不断扩张。

AGI Hunt
8

困住医疗AI的死循环,终于有国产玩家跑通了

文章指出医疗AI行业因数据、模型、场景闭环断裂陷入困境,整体渗透率低。讯飞医疗的星火医疗大模型V3.5评测和临床落地表现出色,其构建自强化循环体系,跑通死循环,或使行业马太效应渐显。

量子位
算法论文8

“AI版LeCun”自己讲解论文,自我进化智能体框架生成精美演讲视频

加州大学研究者提出自我进化的学术演讲智能体框架EvoPresent,它由四个智能体协作,核心美学模型PresAesth模拟人类审美判断。团队构建评测体系,实验显示其在内容与视觉设计上提升显著,让AI兼顾逻辑与美感。

量子位
算法论文8

炸裂提速30倍!Meta提出REFRAF,无需改动模型,让RAG告别冗余与等待

近年来,RAG任务在提升模型回答质量的同时带来性能代价,Meta等团队合作提出REFRAG框架。它将无关段落压缩,引入强化学习选关键段落,实现高达30.85倍的TTFT加速,且无需改模型结构,实用性强。

深度学习自然语言处理
新闻资讯8

MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞

当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。

新智元