RL后训练」共找到 3822 篇相关文章

算法论文8

模型砍掉一大半,准确率反升15%!华科&阿里安全新研究实现ViT近乎无损的类特定压缩|ICLR'26

华中科技大学联合阿里安全部提出Vulcan方法,一改传统压缩策略,通过“先训练再剪枝”实现ViT近乎无损的类特定压缩,为大模型服务小场景提供新路径,论文已被ICLR 2026接收。

量子位
新闻资讯7

OpenAI 内部访谈流出:新 Agent 强到让我们害怕,已接近“自我进化”的边缘!

红杉资本访谈 OpenAI 打造新款 ChatGPT Agent 的核心成员。介绍 Agent 结合多工具、共享状态,能执行复杂任务。还谈及起源、训练方法、应用场景,以及安全挑战和未来规划等。

探索AGI
算法论文8

任务级奖励提升App Agent思考力,淘天提出Mobile-R1,3B模型可超32B

现有Mobile/APP Agent依赖动作级奖励,难应对变化环境。淘天集团团队提出Mobile-R1框架,采用三阶段训练,结合任务级奖励,实验显示其表现超基准,团队还计划开源资源。

量子位
新闻资讯7

她拒了贝索斯,离开黄仁勋,只为回答一个问题:AI能学会物理世界吗?

近日,AI初创公司Accelerated Understanding亮相,由Anima Anandkumar夫妇创立。它未随主流,目标是训练模拟物理现象的通用AI模型。该模型处理数据规模大,公司想解决AI验证瓶颈,产品面向科研工程机构。

DeepTech深科技
新闻资讯7

全球第一位AI哲学家,在谷歌DeepMind的9年:为AGI安全奔走

谷歌DeepMind的政治哲学家Iason Gabriel入职9年,发明的对齐框架影响Gemini训练决策。在AGI承诺与AI现实伤害间,他追问AI伦理。但技术部署快,6700亿美元涌入赛道,伦理红线被踩。

新智元
产品应用8

DeepSeek-OCR 2 架构创新性能暴涨 3.73%

DeepSeek-OCR 2核心技术突破集中于DeepEncoder V2架构创新与端到端优化。如视觉Tokenizer低参高效压缩Token,LLM式视觉编码器用双流注意力驱动因果建模等,还采用三级训练流水线提升效率。

CourseAI
开源动态8

告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆

当前大语言模型在长周期任务中,长时持久记忆管理陷入“精度不够”和“成本太高”的两难困境。中国人民大学团队提出MemSifter框架,将记忆检索工作外包给轻量级代理模型,在8个权威测试中超越现有方案,且已开源。

PaperAgent
算法论文8

告别纯奖励试错!二次尝试+反思蒸馏,复杂任务提升81%

美国南加州大学和宾夕法尼亚大学团队提出新训练范式ERL,将「经验学习」引入强化学习,通过二次尝试和反思蒸馏,在复杂任务中性能显著提升,为构建长期自主智能体提供新思路。

新智元
开源动态8

QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5,提供长文本推理训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。

AINLPer
算法论文8

AAAI 2025 Oral | 火山引擎多媒体实验室提出VQ-Insight,AIGC视频画质理解大模型

火山引擎多媒体实验室与北大合作论文《VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning》入选AAAI 2026口头汇报。VQ - Insight用渐进式框架处理AIGC视频画质理解,实验表现卓越。

机器之心