多任务学习」共找到 6103 篇相关文章

新闻资讯7

Karpathy戳破强化学习神话,首提AI复盘式进化!暴力试错将死

AI大神Karpathy发文指出强化学习(RL)有局限,效率随任务时长下降,与人类学习机制差异大。他提出复盘式进化Scaling范式,虽有很细节待完善,但认为还有更S型增长曲线待发现。

新智元
算法论文8

突破单token预测局限!南洋理工首次将token预测引入微调,编程任务准确率提升11.67%

当前主流大语言模型依赖下一token预测训练,难理解跨token完整概念。南洋理工大学提出概念感知微调(CAFT)技术,首次将token预测引入微调,能让模型理解完整概念,领域实验显示其可显著提升模型性能。

量子位
推荐文章7

AI 产品范式探讨:非线性思维、 Agent 协作才是复杂任务的更优解

本文探讨AI产品范式,指出当前大模型产品设计将其视为‘万能单兵专家’,但复杂任务下效果不佳。提出群体智能、非线性思维等观点,阐述人机协作方向,介绍新范式及AI产品商业化核心是信任。

Founder Park
算法论文8

启发学习:让大模型认知从外化到内生

当下大模型能力靠人为框架,能力上限受限。文章提出“启发学习”,将其集成到推理侧成Isaac框架,通过Prompt与网络层注入复用旧经验,实验显示能大幅提升大模型任务性能。

机器之心
开源动态8

模态LLM超越YOLOv3!强化学习突破模态感知极限|开源

华中科技大学、北京邮电大学等所高校研究团队共同推出纯模态开源LLM——Perception-R1,该模型用强化学习优化视觉感知,目前论文和代码均已开源,其在视觉任务上表现出色,为后续研究提供强大baseline。

量子位
算法论文8

浙大&港理工等提出InfiGUI-R1:利用强化学习,让GUI智能体学会规划任务、反思错误

模态大模型驱动的GUI智能体有潜力,但现有智能体面对复杂任务力不从心。浙大等机构提出InfiGUI-R1及Actor2Reasoner框架,通过两阶段训练提升智能体能力,InfiGUI-R1-3B在基准测试中性能卓越,为GUI自动化工具开辟新道路。

机器之心
算法论文8

Embedding黑箱成为历史!这个新框架让模型“先解释,再学Embedding”

来自高校研究人员推出可解释的生成式Embedding框架GRACE,解决传统文本表征模型黑箱式表征瓶颈。它重新定义对比学习信号,含三个关键模块,训练双模式统一,实验跨任务提升且不损生成能力。

量子位
算法论文7

小扎「梦之队」首批论文上线!LLM自举进化,单步性能狂飙22%

Meta超级实验室MSL新论文探索用强化学习微调大语言模型。提出探索迭代(ExIt)法,基于RL自动课程学习,训练仅需单步任务,模型学会步自我改进。在MLE - bench上,ExIt相对GRPO提升约22%。

新智元
算法论文7

谷歌研究院探索智能体协调的扩展原则

谷歌研究院对180种智能体配置对照评估,得出‘AI智能体系统首批定量扩展原则’。发现智能体协同效果因任务而异,还指出工具使用瓶颈等问题,且开发预测模型辅助架构选择。

InfoQ
算法论文8

经典之作!Agent无需奖励也能学习:通过“早期经验”的Agent Learning

该论文提出‘早期经验’范式,让智能体通过执行动作、观察结果状态学习,无需外部奖励。它能降低数据依赖,提升泛化与鲁棒性。实验显示,其在样环境中效果出色,为智能体训练提供新思路。

深度学习自然语言处理