多任务训练」共找到 6569 篇相关文章

算法论文8

模型大一统?1100个模型殊途同归,指向一个「通用子空间」!

约翰斯・霍普金斯大学研究发现,1100个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间。此研究为神经网络参数空间“通用性”提供严谨实证,虽成因待探索,但意义深远。

AINLPer
算法论文8

告别纯奖励试错!二次尝试+反思蒸馏,复杂任务提升81%

美国南加州大学和宾夕法尼亚大学团队提出新训练范式ERL,将「经验学习」引入强化学习,通过二次尝试和反思蒸馏,在复杂任务中性能显著提升,为构建长期自主智能体提供新思路。

新智元
开源动态8

SOTA级视频编辑新方法:无需训练一句话编辑视频,背景保持100%

传统视频编辑工作流被AI重塑,但现有AI方法存在问题,源于反演 - 编辑范式。西湖大学AGILab提出无需反演和训练的FlowDirector,开销低、支持广且能100%保持背景,还采用新策略优化。

量子位
产品应用8

每一幕皆可控!字节发布主体视频生成神器,人人皆主角

字节发布主体视频生成神器MAGREF,基于一张参考图像,能生成主体高度一致的视频,人同台也不串脸。它采用三阶段数据处理流程,构建在DiT架构上,实现复杂视频生成任务

量子位
算法论文7

直播预约 | 强化学习训练能否不依赖外部知识优化模型的弱点?

论文提出 SwS 框架,针对强化学习场景,利用模型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行项扩展,在个基准测试集和模型上验证有效,性能提升显著。

深度学习自然语言处理
开源动态8

微软开源2025 ICML获奖框架,终结大模型轮对话严重缺陷

微软开源2025年ICML获奖框架CoLLabLLM,可解决大模型轮对话缺陷。它由四大模块构成,经轮对话模拟和奖励优化模型。在三大基准平台测试显示,能在任务中高效协作。

AIGC开放社区
算法论文7

少说‘Wait’,做题:NoWait重塑大模型推理路径

现代大模型在复杂推理时爱用自我反思词,触发冗余验证循环,拖慢速度、增加算力消耗。NoWait方法零训练成本,通过抓关键词、扩展变体、实时屏蔽,让模型跳过废话,在任务中表现出色,且颠覆对推理的认知。

深度学习自然语言处理
新闻资讯7

直播预约 | Transformer 模型能否通过连接训练数据中的离散知识进行推理?

为研究Transformer是否具备组合式推理能力,提出FTCT合成任务。实验发现Few - shot CoT提示可激发推理能力,训练与测试相似度、模型复杂度影响推理能力。还分析了其内在机制,展示其泛化推理潜力。

深度学习自然语言处理
产品应用8

AI Coding新王登场!MiniMax M2.1拿下语言编程SOTA

MiniMax发布旗舰级Coding & Agent模型M2.1,在Multi - SWE - bench榜单中以10B激活参数拿下49.4%成绩,超越竞品成SOTA。它解决模型‘偏科’问题,适配开发工具链,实测在语言编程任务中表现出色。

量子位
开源动态8

Identity-GRPO:阿里开源人物定制化视频生成的后训练优化算法

阿里团队提出Identity - GRPO算法解决人物视频生成身份一致性问题。构建约15000个标注样本数据集,基于Qwen2.5VL设计奖励模型,项策略增强训练稳定性,实验验证性能提升显著。

PaperAgent