智能体训练」共找到 5190 篇相关文章

算法论文8

RLHF与RLVR全都要,陈丹琦团队最新力作将推理能力拓展到通用智能

普林斯顿大学陈丹琦团队发布学术成果,提出基于模型奖励思维的强化学习(RLMT)方法,弥合专门推理与通用对话能力差距,将链式思维优势扩展到更广泛范围,提升整对话表现。

机器之心
开源动态8

空间智能卡脖子难题被杭州攻克!难倒GPT-5后,六小龙企业出手了

杭州群核科技发布空间大模型,深耕室内场景,直指‘空间一致性’痛点。其开源子模型具真实感全息漫游、可交互等特点。当前空间模型处早期,群核提出‘三位一’战略,还将开源促行业发展。

量子位
新闻资讯8

《“人工智能+”行动意见》深度解读:从人口红利到智能红利,中国经济社会变革新引擎

《“人工智能+”行动意见》是全面重塑中国经济、社会与治理系的国家战略。它以应用促创新,定位AI为新质生产力关键引擎,涉及多领域变革,还采取不对称竞争策略,应对国际博弈。

AI Reading Hub
推荐文章7

对谈 Memories AI 创始人 Shawn: 给 AI 做一套“视觉海马”|Best Minds

本文是对 Memories AI 创始人 Shawn 的访谈。他指出当下 AI 记忆多为“上下文工程”,其团队致力于打造视觉记忆层 LVMM。还探讨了视觉与文本记忆区别、LVMM 架构及应用场景等,认为视觉记忆将成下一代 AI 核心。

海外独角兽
新闻资讯7

AI自我训练?OpenAI研究员Jason Wei泼冷水:它的三大瓶颈你根本想不到

OpenAI研究员Jason Wei认为AI自我完善是未来趋势,但不会‘瞬间爆发’,而是漫长过程。他从三方面阐述,包括自我完善非一蹴而就、不同领域完善难度有差异、科学进步受真实世界实验限制。

AI寒武纪
算法论文8

清华刘知远团队:高质量LLM训练数据获取新方法!成本降90%,性能大提升

清华刘知远团队论文提出全新数据筛选方案,解决传统数据筛选验证慢、主观性强问题。发明‘半成品加工法’降成本,用fastText筛数据,筛出Ultra - FineWeb数据集,提升模型性能,还计划拓展到专业领域。

深度学习自然语言处理
新闻资讯7

Claude1.7万字系统提示词全网刷屏!Karpathy锐评:LLM训练缺乏关键范式

Claude近1.7万字系统提示词在GitHub泄露,网友称是提示技术的金矿。大神卡帕西提出系统提示学习新范式,模拟人类经验积累,让LLM有‘记忆’功能,引发网友激烈讨论。

量子位
算法论文7

机器人从炫技 Demo 走向上岗,两篇 ICML 顶会论文拆解背后的智能底座

在WRC世界机器人大会上,云蝶科技发布RoboForge系统级具身大脑和WING任务型本。其科研团队两项成果POLIA与Strat-Reasoner发表于ICML 2026,从视觉证据和他者意图两方面,为理解具身大脑技术提供切口。

AI科技评论
算法论文8

大模型"温故而知新"实现了!无需历史数据,Octopus 效果超越全数据训练|CVPR‘26 Octopus

上海交通大学与vivo团队提出全新持续学习框架Octopus,首创无需历史数据的梯度正交化技术。实验显示,它在UCIT基准上表现超SOTA方法,还实现正向后向迁移,适合端侧部署。

量子位
新闻资讯7

优必选「拆墙」:具身智能行业等了三年的「安卓时刻」来了吗?

4月23日,优必选在FAIR plus 2026机器人全产业链接会期间发布开发者专属社区「Thinker Cosmos」。该平台能连接场景需求与开发者,解决行业痛点,以分层服务构建生态,还提及聚焦家庭场景刚需点。

AI科技评论