强化预训练」共找到 2553 篇相关文章

算法论文8

强化学习新发现:无需数学样本,仅游戏训练AI推理大增

莱斯大学、约翰斯・霍普金斯大学和英伟达研究团队有颠覆性发现,让多模态大语言模型玩简单游戏,无需数学样本,就能显著提升其多模态推理能力。提出的ViGaL方法在多个基准测试中表现出色。

机器之心
算法论文8

无需训练的LLM对齐方法综述

大型语言模型应用引发担忧,传统微调方法有短板,免训练对齐(TF Alignment)应运而生。本文是首篇系统综述TF对齐技术的论文,提出三阶段分类框架,实验显示TF方法优势明显,还指明未来研究方向。

深度学习自然语言处理
算法论文8

SAPO:让强化学习告别“硬剪切”

强化学习是提升大语言模型推理能力的核心技术之一,但现有基于组的策略优化方法面临 token 级重要性比率高方差问题。GRPO 和 GSPO 采用硬剪切有学习信号丢失等缺点。为此提出 SAPO,用平滑门控函数替代硬剪切,实验效果良好。

通义千问Qwen
新闻资讯8

Ilya 最新访谈,训练时代终结后,AI行业来到了哪里?

Ilya接受90多分钟深度访谈,指出当前大模型泛化能力远不如人,Scaling时代终结,研究时代回归。还谈到AI经济影响与跑分不匹配、泛化能力鸿沟、情感价值等问题,测超级智能5 - 20年到来。

探索AGI
产品应用8

阿里WebDancer:训练类DeepReaserch的Agentic Model

来自阿里巴巴通义实验室的研究员推出WebDancer,这是一个原生信息检索的Agentic Model,能自主浏览网页、思考和决策。它基于ReAct框架,经多阶段训练,在信息检索基准测试中表现出色,为解决复杂检索问题提供新思路。

PaperAgent
产品应用7

Jina Embeddings v4 的量化感知训练

文章聚焦Jina Embeddings v4的量化感知训练。介绍量化技术可压缩向量体积、提升检索效率,对比四种主流量化方法,重点实验PTQ和Output QAT,还测试非对称量化,给出实验结果与结论。

Jina AI
新闻资讯7

Anthropic 研究员:强化学习将推动 Transformer 实现 AGI

在 AI Agenda Live 纽约活动上,Anthropic 强化学习团队技术负责人 Sholto Douglas 称,无需新架构突破,强化学习能让 Transformer 达人类专家级别表现,接近 AGI。但定义「好表现」是难题,Anthropic 或投 10 亿美元提升模型企业应用表现。

AGI Hunt
新闻资讯8

Meta华人新秀毕树超,重磅爆料下一代LLM路线!RL+训练直通AGI

OpenAI前研究员、Meta成员毕树超在哥大演讲指出,AGI需高质数据、好奇驱动探索与高效算法,Scaling Law有效,规模决定智能,终身学习是重点,还探讨了AGI面临的诸多问题与挑战。

新智元
算法论文8

阿里:RL强化LLM推理,是技巧还是陷阱?

近年来,强化学习(RL)成为解锁大型语言模型(LLM)复杂推理能力的关键工具,但该领域也面临技术选择困境。阿里联合多所高校的论文通过大规模可复现实验,揭示主流RL技巧的机制与适用场景,还发现极简组合(Lite PPO)性能超越复杂方案。

深度学习自然语言处理
新闻资讯7

Karpathy:强化学习「有点问题」,突破还需新算法

前特斯拉AI总监、OpenAI创始团队成员Karpathy发文称,强化学习虽能带来更多收益,但机制「可疑」,不像人类解决智能任务的方式。他提出新算法框架,还指出当前存在诸多待解决的问题。

AGI Hunt