多任务学习」共找到 6120 篇相关文章

新闻资讯8

重磅发布 |智能体协同驱动,新一代流体力学工业软件平台正式亮相!

2025年11月29日,第四届智能流体力学产业联合体大会上,西北工业大学等联合发布“智能体协同驱动的新一代流体力学工业软件平台”,解决流体设计仿真瓶颈,含完整体系,有项关键技术及典型应用场景。

力学与人工智能
新闻资讯7

OpenAI解散「灾难风险应急」团队!GPU大神Scott Gray也跑路了

OpenAI解散「Preparedness」团队,该团队负责评估自家AI灾难级社会风险。官方称安全工作已融入开发流程。此前个安全团队也已解散,名安全高管离职,引发员工不安。

量子位
算法论文7

Thinking Machines曝LoRA终极指南:10倍学习率,媲美全参微调

Thinking Machines推出论文《LoRA Without Regret》,研究LoRA与FullFT达到相近表现的条件。通过实验发现,把握关键细节,LoRA可与FullFT性能相当,还探讨了关键因素、批大小效应等内容。

新智元
算法论文8

Nature重磅:AI和人脑的根本区别找到了,我们对“聪明”的理解可能全错了

2025年《自然·机器智能》研究指出AI和人类在‘泛化能力’上本质不同。人类泛化靠抽象,学习高效;AI泛化靠统计,学习笨重。未来AI与人应互补协作,而非谁取代谁。

AIGC开放社区
推荐文章7

现在模型这么强还需要专业提示词吗?

文章探讨是否还需专业提示词,指出简单任务无需复杂提示词,但复杂任务时,它能像‘数学公式’拆解需求,还能充当‘工作流经理’。用好提示词能让AI成生产力工具。

宝玉AI
算法论文8

告别「利用率崩溃」:GIPO开启大模型强化学习高效训练新方法 | ICML 2026

树根科技与三一集团团队联合提出 GIPO 算法,在机器人操控及大语言/视觉动作模型强化学习训练中,缓解了策略滞后痛点,改善了 PPO 硬截断引发的‘利用率崩溃’问题。介绍了 GIPO 算法原理、优势及实验结果。

AI科技大本营
算法论文8

SFT在帮倒忙?新研究:直接进行强化学习,模型模态推理上限更高

学界常用「监督微调(SFT)+ 强化学习(RL)」训练大模型。但新研究发现,SFT 会引发「伪推理路径」,阻碍推理进步。相比之下,直接进行 RL 训练,模型模态推理上限更高,该团队训练的模型还刷新了纪录。

机器之心
新闻资讯8

强化学习之父Richard Sutton:人类数据耗尽,AI正在进入“经验时代”!

强化学习之父Richard Sutton在演讲中指出,人类数据耗尽,AI正进入“经验时代”,真正的AI要从与世界互动的“经验”中获取数据。他还认为创造超级智能体是好事,人类和AI繁荣应基于“去中心化合作”。

AI科技大本营
开源动态8

RL缩放王炸!DeepSWE开源AI Agent登顶榜首,训练方法、权重大公开

今天凌晨,Together.ai联合Agentica开源AI Agent框架DeepSWE,基于Qwen3 - 32B模型用强化学习训练。所有内容开源,测试中性能超所有开源Agent框架,证明强化学习训练潜力。

AIGC开放社区
开源动态8

社区供稿 | VibeVoice实现90分钟、角色播客生成,拓展语音合成新边界

微软亚洲研究院提出全新语音生成模型 VibeVoice,采用 next - token diffusion 机制,能将文字脚本转为最长 90 分钟、最 4 人对话的高质量播客音频,在方面有显著优势,未来潜力大。

Hugging Face