训练方法」共找到 3281 篇相关文章

算法论文8

任务级奖励提升App Agent思考力,淘天提出Mobile-R1,3B模型可超32B

现有Mobile/APP Agent依赖动作级奖励,难应对变化环境。淘天集团团队提出Mobile-R1框架,采用三阶段训练,结合任务级奖励,实验显示其表现超基准,团队还计划开源资源。

量子位
推荐文章8

翁荔最新万字长文:Why We Think

北大校友、前OpenAI华人VP翁荔发布万字长文《Why We Think》,围绕“测试时计算”和“思维链”,探讨提升模型性能的方法,涉及心理学类比、基于Token的思考、分支与编辑等多方面内容。

量子位
推荐文章7

Agent记忆系统:6大核心操作全景解读

自LLM进入Agent时代,记忆模块成研究重点。以往研究有缺憾,作者提出全面AI记忆研究框架,对记忆表示分类,引入六种基本记忆操作,并映射到多方面,还阐述各部分具体方法

CourseAI
新闻资讯7

她拒了贝索斯,离开黄仁勋,只为回答一个问题:AI能学会物理世界吗?

近日,AI初创公司Accelerated Understanding亮相,由Anima Anandkumar夫妇创立。它未随主流,目标是训练模拟物理现象的通用AI模型。该模型处理数据规模大,公司想解决AI验证瓶颈,产品面向科研工程机构。

DeepTech深科技
新闻资讯7

全球第一位AI哲学家,在谷歌DeepMind的9年:为AGI安全奔走

谷歌DeepMind的政治哲学家Iason Gabriel入职9年,发明的对齐框架影响Gemini训练决策。在AGI承诺与AI现实伤害间,他追问AI伦理。但技术部署快,6700亿美元涌入赛道,伦理红线被踩。

新智元
算法论文8

CVPR 2026|突破3D空间推理瓶颈:北大联合南科大提出QuatRoPE,让大模型精准理解三维物体关系

北大联合南科大团队提出全新 3D 位置嵌入方法 QuatRoPE,改善大语言模型 3D 空间推理痛点。还提出 IGRE 降低干扰,构建 ASR 基准评估能力。研究被 CVPR 2026 接收,代码与模型已开源。

机器之心
产品应用8

DeepSeek-OCR 2 架构创新性能暴涨 3.73%

DeepSeek-OCR 2核心技术突破集中于DeepEncoder V2架构创新与端到端优化。如视觉Tokenizer低参高效压缩Token,LLM式视觉编码器用双流注意力驱动因果建模等,还采用三级训练流水线提升效率。

CourseAI
算法论文8

无需SFT也不用RL,样本级推理优化神器SLOT来了,准确率轻松+10%

西湖大学MAPLE实验室开发的SLOT方法,无需SFT和RL,让模型推理时“临时学习”具体问题。它简单易实现,计算开销小,能使模型准确率大幅提升,还无需额外资源,在各规模模型上效果显著。

机器之心
算法论文8

告别纯奖励试错!二次尝试+反思蒸馏,复杂任务提升81%

美国南加州大学和宾夕法尼亚大学团队提出新训练范式ERL,将「经验学习」引入强化学习,通过二次尝试和反思蒸馏,在复杂任务中性能显著提升,为构建长期自主智能体提供新思路。

新智元
推荐文章7

Claude Skills 写作指南:从0到1看完就会,不会来找我

本文介绍Claude Skills写作指南,指出传统提示词使用麻烦,而Skills能解决问题。阐述其适用场景、定义、原理,还讲了创建方法、作者实践及完整写作工作流,可按需管理提示词。

AI产品自由