强化预训练」共找到 2553 篇相关文章

算法论文8

ACL'25最佳论文解读 | 大模型也会‘弹簧回弹’?揭秘 LLM 对齐的脆弱根源

本文分享 ACL 2025 最佳论文,指出训练大模型存在‘抗对齐’的 Elasticity 现象,即对齐微调只是暂时拉伸,后续微调会让其迅速弹回训练分布。研究量化该概念,用‘压缩理论’刻画对齐并实验验证。

PaperAgent
开源动态7

强化学习+MCP=王炸?开源框架教AI在MCP中玩转工具解决任务,实测效果超越GPT!

科技公司OpenPipe提出全新开源强化学习框架MCP·RL,只需一个MCP Server地址,agent就能自动发现工具、生成任务,在闭环反馈中摸索出最优调用策略,实测在2/3的benchmark上达或超SOTA性能。

量子位
开源动态8

3B模型性能小钢炮,“AI下半场应该训练+验证两条腿跑步”丨上海AI Lab&澳门大学

上海AI Lab和澳门大学联合发布通用答案验证模型CompassVerifier与评测集VerifierBench,填补Verifier领域循环迭代体系空白。AI下半场评估比训练更重要,当前验证方法有困境,新模型验证精度高且能用于强化学习。

量子位
新闻资讯8

硬核「吵」了30分钟:这场大模型圆桌,把AI行业的分歧说透了

在WAIC 2025大模型论坛的“模型之问”圆桌中,多位行业大佬围绕大模型展开辩论,话题涉及训练范式、模型架构、数据、开闭源等核心问题,不同观点碰撞,深入探讨大模型技术演进与发展之路。

机器之心
算法论文7

表格建模也能Scaling?树模型的时代要改变了

文章指出 AI 算力增长与结构化数据建模以树模型为主形成反差。浙大 X 蚂蚁 AIforData 团队探索结构化数据训练,在表格数据和行为序列训练上有成果,验证了 Scaling Law,示结构化数据建模范式将改变。

机器之心
开源动态8

月之亮剑:万亿参数,造就国内首个 Agentic Model?

月之暗面发布全球首个万亿参数且直接开源的 Agentic Model Kimi - K2,它将 AI 下半场与经验时代理论融合。在测评中表现出色,Kimi 还通过创新方法完成训练和后训练,并将成果开源,给中国开发者更多自主权。

特工宇宙
产品应用8

腾讯混元A13B用130亿参数达到千亿级效果,Flash Attention作者点赞

腾讯混元A13B模型仅130亿激活参数,却能和千亿级大模型竞争,获Flash Attention作者赞叹。它精准卡位性能与效率‘甜蜜点’,依托高质量训练和结构化后训练,多方面表现突出且已全面开源。

量子位
新闻资讯8

30万被引的AlphaGo之父,创业4个月融资近百亿元!笃信RL实现ASI

4月27日,AlphaGo之父David Silver创办的Ineffable Intelligence获11亿美元种子轮融资,投后估值51亿美元。该公司押注强化学习和自我经验学习,试图挑战大模型主线。未来或采用大模型训练强化学习混合路线。

新智元
算法论文8

突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力

多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。

量子位
算法论文8

SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益

来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。

AI科技评论