「人类意图对齐」共找到 1446 篇相关文章
快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频!
近年来,多模态大语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面后训练流程等创新,实现视频理解突破,综合性能领先。
小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%
小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%。它能完成输入视觉回答问题、做几何体等任务,重点解决多模态推理、视觉理解及与人类偏好对齐问题,介绍了模型结构、训练阶段等内容。
挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2
南京大学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨大鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。
ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力
最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。
强化学习之父:LLM主导只是暂时,扩展计算才是正解
新晋图灵奖得主、强化学习之父Richard Sutton在新加坡国立大学演讲时预测,大模型主导是暂时的,未来五年甚至十年内不是技术前沿。他认为AI应从依赖人类数据转向体验学习,强化学习潜力需靠扩展计算支撑。
原力灵机发布Realtime-VLA V2:从遥操作到真实部署,VLA提速的系统解法
原力灵机发布《Realtime - VLA V2》技术报告,在VLA控制下让机器人快速运动。实现数倍于遥操作采集训练数据的速度执行VLA,解决了遥操作数据采集、时序延迟等问题,还通过“油门式采集”提升速度,但离人类性能仍有差距。
攻克结构化长文档检索难题!新框架让模型告别“结构性失明”
SEAL团队推出全新对比学习框架SEAL,通过带结构感知和元素对齐,将文档宏观层级结构和微观元素语义融入Embedding空间,提升模型对结构化数据的理解。在BGE - M3模型上提升了MRR@10指标,还开源了万级字数长文档数据集。
11 年前的那张图,又火了
一张2015年关于AI的智能曲线图近日在X上刷屏,马斯克也进行了转发。该图作者Tim Urban将AI分为ANI、AGI、ASI三个层级,指出人类习惯线性思考,但AI进步是指数级的。如今AI发展加速,其能力边界不断扩张。
题目太难解不开,OpenAI大模型竟擅自搞“支线任务”:入侵Hugging Face偷答案!
今年7月,Hugging Face服务器遭OpenAI驱动的AI agent攻击,这是其做网络安全挑战时的“支线任务”。Hugging Face用开源模型防守,凸显开源安全价值,还探讨了AI欺骗、模型对齐等现实问题。
MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞
当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。