元能力对齐」共找到 3921 篇相关文章

开源动态8

R-HORIZON:长程推理时代来临,复旦NLP&美团LongCat重磅发布LRMs能力边界探测新范式

复旦大学与美团LongCat Team联合推出R - HORIZON,它是首个系统性评估与增强LRMs长链推理能力的方法与基准。提出Query Composition方法构建评测基准和训练数据,评测发现主流模型长链推理性能断崖式下降,还分析出三大瓶颈,训练后模型性能双重提升。

机器之心
新闻资讯7

豆包手机被曝搭载锤子 SmartisanOS,二手价逼近8000!罗永浩点赞字节:技术革命谁也挡不住

近日,豆包手机助手发售即被抢空。有博主发现其系统有锤子科技遗留字样。该手机官方价3499,二手溢价超一倍。罗永浩点赞。不过,它风波不断,官方回应是技术预览版,不面向普通消费者。

AI前线
算法论文8

突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力

多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。

量子位
新闻资讯7

10 天 3000 ,一人造出全球 AI 爆款!好莱坞导演抢人、游戏版引爆期待,合作细节首次披露

中国 29 岁中专毕业的 AI 视频创作者 Mx - Shell 用 10 天、3000 成本做出 AI 短片《丧尸清道夫》爆火,海外 CEO 邀合作。其游戏版正制作,Yoroll 创始人谈 AI 视频游戏赛道玩法、商业化及行业变革。

InfoQ
算法论文8

为防AI刷题,Nature等顶刊最新封面被做成数据集,考验模型科学推理能力|上海交通大学

上海交通大学王德泉教授课题组提出MAC基准,用顶级期刊最新封面构建测试集,评测多模态大模型能力。研究设计两种含“语义陷阱”的测试任务,发现顶尖模型有局限,还提出DAD方法提升表现,采用双重动态机制。

量子位
新闻资讯8

首形科技获得新一轮数亿A1轮融资,人脸机器人首登《科学·机器人学》封面

首形科技完成数亿A1轮融资,资金用于系统迭代、部件优化及市场拓展。其创始人胡宇航在仿生情感机器人研究成果丰硕,人脸机器人登《科学·机器人学》封面,突破规则驱动局限,推动AI走向实体化。

五源资本 5Y Capital
新闻资讯7

“Claude Code 这条路线错了”!老级 AI 大师 Jeremy Howard 开炮:马斯克和 Dario 根本不懂现代软件工程

老级 AI 大师 Jeremy Howard 批评当下技术话题,称马斯克和 Dario 不懂现代软件工程。他认为大模型虽能生成代码,但难胜任软件工程,Claude Code 未突破现有技术,还会削弱开发者对系统的理解。

InfoQ
算法论文8

监督学习未死,一题训练五小时起飞!华人学者新方法20倍训练效率释放大模型推理能力

大模型推理能力研究中,RL训练资源成本高、不稳定,传统SFT低数据量易过拟合。加拿大滑铁卢大学华人团队提出One - Shot CFT方法,用一题多解多点评训练,仅需约5个GPU小时,效果好、稳定性强。

量子位
开源动态8

o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界

GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。

AI科技评论
算法论文8

ICSE 2026杰出论文 | 突破代码模型真实工程落地瓶颈,北大团队提出SEAlign对齐框架:显著提升软件工程智能体决策质量

现有代码模型在经典基准表现好,但在真实软件工程环境表现差。北大金芝、李戈团队提出 SEAlign 框架,通过识别与对齐智能体轨迹关键决策点,提升模型在真实工程任务表现,成果获 ICSE 2026 杰出论文奖。

机器之心