多任务学习」共找到 6103 篇相关文章

算法论文7

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在任务测试中提升了成功率。

机器之心
开源动态8

吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板

Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用自监督学习,无需人工标注,可生成强大图像特征,在任务超专用方案,NASA已用其探索火星,还能推动行业进步。

新智元
算法论文8

大模型如何泛化出智能体推理能力?清华提出策略游戏自博弈方案MARSHAL

近日,清华大学等机构研究团队提出 MARSHAL 框架,利用强化学习让大模型在策略游戏自博弈。实验表明,轮、智能体训练提升了模型博弈决策水平,将推理能力泛化到通用智能体系统,在一般推理任务表现显著提升。

机器之心
算法论文8

比人类专家快2倍,斯坦福联合英伟达发布TTT-Discover:用「测试时强化学习」攻克科学难题

斯坦福与英伟达等机构联合提出 TTT - Discover 方法,让 LLM 在测试时强化学习。它在任务上成绩出色,如在数学、GPU 内核等领域超越人类和其他 AI,计算成本低,或为持续学习打开新空间。

机器之心
算法论文8

AI在线强化学习“边做边学”,斯坦福团队让7B小模型性能飙升,甚至超越GPT-4o

斯坦福等团队提出新范式AgentFlow,由四个智能体组成,用在线强化学习持续提升智能体系统推理能力。以Qwen - 2.5 - 7B - Instruct为基座模型的它在基准测试表现突出,甚至超越GPT - 4o等大模型。

量子位
产品应用7

Clawdbot火了,Anthropic急了,Claude Code连夜更新了Agent任务系统。

Claude Code更新Tasks系统,将原TODO系统升级,任务可借助文件系统持久化,实现进度同步。Task变为依赖图,有阻塞关系,还能让个Agent分工协作,任务状态存本地文件,方便查看。

探索AGI
新闻资讯7

Devin CEO:别搞智能体!Anthropic:我们性能提升90%!

最近,开发Devin的Cognition CEO发文称不要构建智能体系统,而Anthropic分享构建智能体研究系统,性能提升90%。Cognition认为智能体协同难,坚持单线程线性Agent;Anthropic用工程设计绕开瓶颈。二者因任务类型不同观点有别。

探索AGI
算法论文7

苹果AI选Mamba:Agent任务比Transformer更好

苹果新研究指出,在长任务交互的Agent式任务中,基于SSM架构的Mamba在效率与泛化能力上超Transformer。虽Mamba有局限性,但引入外部工具后性能显著提升。

量子位
开源动态8

拒绝传统 Router“瞎指挥”,智能体如何实现智能任务分配?

企业级智能体系统瓶颈常是负责分发任务的传统 Router 太“傻”,搞不定跨域、解不了冲突、跟不上变化。腾讯云开源 TCAR 智能路由模型,它先推理再选 Agent 集合,经数据集评测表现出色,还提供完整开源范式。

InfoQ
开源动态8

北大开源统一世界模型框架:类合成推理任务一套搞定

世界模型研究中,不同任务存在接口不统一等问题。北大DCAI课题组联合方推出OpenWorldLib推理框架,整合模态能力,构建标准化接口体系,在任务上评估效果良好,降低研发门槛。

量子位