多任务强化学习」共找到 3185 篇相关文章

算法论文8

数据蒸馏的双重突破:从几何保真到对抗鲁棒

深度学习中,数据集蒸馏可用精简合成样本替代庞大训练集且不牺牲模型性能,但面临精度和可靠性两大难题。两篇发表于 ICCV 2025 和 AAAI 2025 的论文分别给出解决方案,且代码已开源。

深度学习自然语言处理
算法论文8

综述 | Agentic RL for LLM的最新进展与未来挑战,idea满满

该综述对新兴的Agentic RL进行系统性总结与展望,介绍其与传统LLM - RL区别,从核心能力和任务视角阐述其应用,梳理支撑系统,指出核心挑战与未来方向,展示通向通用AI的希望之路。

深度学习自然语言处理
推荐文章8

关于 Multi-Agent 到底该不该做,Claude 和 Devin 吵起来了

有两篇多智能体文章引发热议。Anthropic分享多智能体研究系统构建经验,指出适合特定任务;Cognition认为当下AI Coding暂不适用多智能体。文章还介绍多智能体架构、提示词原则等内容。

Founder Park
算法论文7

OpenClaw爆火背后,仅8.6%用户能察觉异常!多校联合实证

OpenClaw等AI智能体爆火,其安全隐患凸显。多校联合研究发现,仅8.6%的用户能感知智能体媒介欺骗,总结了6类认知失效模式,认为体验式学习或比静态提醒更能提升用户警觉性。

新智元
新闻资讯8

Bengio 15 年前论文再夺 AAAI 奖!AI 正告别单纯炫技,走向真实世界

全球人工智能顶会AAAI揭晓年度奖项,Yoshua Bengio 2011年论文获经典论文奖。今年5篇杰出论文研究方向指向AI从炫技走向应用,如ReconVLA改进VLA视觉感知,CADYT解决连续时间因果结构学习空白等。

InfoQ
产品应用8

起猛了,追觅的扫地机、割草机、洗护机器人在CES成精了!

在AI浪潮下,具身智能正加速涌入家用场景。追觅在CES带来多款「具身智能」产品,如洗护、割草、扫地等机器人,它们能自主决策执行任务,或成具身智能家庭化量产进程最快的公司。

量子位
算法论文8

LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制

中国科学院自动化研究所、腾讯AI Lab团队从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上性能显著优于传统算法。

深度学习自然语言处理
新闻资讯7

安全噩梦:Docker 警告 MCP 工具链中存在的风险

Docker 博文警告,基于 MCP 构建的 AI 开发工具引入安全漏洞,如凭证泄露等。MCP 发展迅猛但部分实现有隐患,Docker 分析发现广泛漏洞,还提出强化方法应对风险,其他厂商也有类似担忧。

AI前线
新闻资讯8

Hinton能重新坐下了,什么时候开始的?

AI教父Geoffrey Hinton来上海了,他曾因腰伤近18年几乎无法坐下,如今却能安然坐下。本文讲述他科研生涯,从坐冷板凳到引领深度学习变革,又在AI发展巅峰时反思风险,提醒人们警惕。

量子位
开源动态8

OpenAI去年挖的坑填上了!奖励模型首现Scaling Law,1.8B给70B巨兽上了一课

全新奖励模型「POLAR」采用对比学习范式,摆脱对海量人工标注依赖,有强大Scaling潜力。它衡量训练与目标策略「距离」作奖励信号,用自动化合成数据预训练,小模型能超越大数十倍规模对手。

新智元