科学多任务学习」共找到 3304 篇相关文章

算法论文8

10万token自然语言推理,让30B-A3B模型站上奥赛金牌线

上海人工智能实验室报告显示,30B - A3B规模的SU - 01模型不依赖外部工具,经训练在IMO、USAMO、IPhO等奥赛评测达金牌水平。研究还验证更高效科学推理系统路线,有望用于更多科学问题。

机器之心
算法论文8

为什么给机器人装上昂贵的触觉传感器,反而让它变笨了?

伊利诺伊大学香槟分校等多校合作研究发现,当前机器人学习主流的多传感器融合算法(特征拼接)在处理任务时存在局限,给机器人加触觉数据会使抓取成功率暴跌。研究提出组合策略解决问题,经测试效果显著。

机器之心
开源动态8

人大和微软开源Arbor,一棵假设树突破自主科研新高度

中国人民大学和微软研究者推出Arbor,它将实验挂到假设树,让研究信息跨周期保留。在六道真实研究任务中表现优异,增益超Codex和Claude Code,且成本相当,还能从失败中积累经验。

AIGC开放社区
算法论文8

RL成本降幅超90%!Meta提出Agent训练新范式DreamGym

传统强化学习(RL)训练LLM Agent面临成本高、任务多样性不足等挑战。Meta团队提出DreamGym框架,以经验合成为核心,通过三大组件协同工作,在多种任务和模型上提升性能,为通用Agent训练开辟新路径。

深度学习自然语言处理
算法论文7

「Next-Token」范式改变!刚刚,强化学习预训练来了

微软新研究提出「强化预训练(RPT)」新范式,将下一个 token 预测任务重新定义为推理任务,可利用海量文本数据进行通用强化学习。该方法有可扩展性、低风险等优点,实验显示其提升了语言建模能力。

机器之心
新闻资讯7

Nature重磅发文:深度学习x符号学习,是AGI唯一路径!

大模型虽惊艳,但权威认为仅靠神经网络难达人类级智能。符号AI曾被边缘化,如今‘神经–符号融合’升温。神经网络与符号算法各有利弊,业界探索出不同融合路径,不过对其能否通往AGI仍存争议。

新智元
算法论文8

强化学习也能预训练?效果可提升20倍,华人新作引爆RL新范式!

伯克利团队提出新方法InFOM,不依赖奖励信号,能在多任务中超强迁移与推理。在36个基于状态和4个基于图像的任务测试中,InFOM表现出色,在jaco任务上改进达20倍。

新智元
算法论文7

Nature重磅研究:大模型让你变得更聪明还是更笨了?创造力增强还是扼杀了?

《自然》研究表明,大语言模型对创造力的影响取决于任务。简单任务中,它像灵感助推器,分担认知负荷;复杂任务里,易致‘创意固化’,长期依赖还可能使大脑‘变懒’。需按需调节使用。

AIGC开放社区
推荐文章7

The Batch: 893 | 从预测到执行

2026 年 AI 研究应认识到能预测的模型不等同于能行动的系统。过去十年在被动预测和生成建模成就非凡,但现实任务需系统执行一系列动作。转向长周期任务和目标导向 AI 系统有两大好处。

DeeplearningAI
算法论文8

告别通用具身模型崇拜:具身智能走向异构策略编排

当VLA、WAM等机器人控制策略在各自任务中表现出色,如何为子任务匹配合适策略成完成复杂长时序任务关键。RoboHarness解决异构策略协同难题,通过协同调用策略提升成功率。

机器之心