垂类Agent训练」共找到 4536 篇相关文章

算法论文8

14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1

如今的大语言模型推理能力关键在于测试时扩展,但长思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。

机器之心
推荐文章7

从后训练回到预训练,LLM+RL 的潜力兑现有有机会走更远吗?

RL与LLM结合是重要技术方向,应用从后训练延伸至预训练。虽看似为LLM+RL带来希望,但RL本身有局限。微软等提出的RPT有潜力,不过训练语料等未广泛验证,且需大量计算资源。

机器之心
算法论文8

RL训练一层就够了!单层RL超越全参数训练,跨任务跨模型跨算法全部验证

明尼苏达大学、北大和亚马逊团队研究发现,RL收益集中在中间层,训练单层可超全参数训练。他们提出层贡献度指标,经多模型、算法、任务实验验证,还给出三种训练优化策略。

机器之心
算法论文8

Agent框架各自为战?谷歌&微软:用Agent-KB让经验自由流动

当前不同框架的Agent知识无法互通,谷歌、耶鲁、字节、oppo等团队联合提出Agent KB,这是通用记忆基础设施,能让异构Agent框架共享经验。它有师生双阶段检索机制,实验验证其能带来显著增益。

PaperAgent
开源动态7

又一个开源 AI Agent 杀到!II-Agent,号称“全球最强”,击败 Genspark 和 Manus,跑分直逼人类

AI Agent 赛道迎来新成员 II-Agent,由 Intelligent Internet 团队打造且将开源,获前 Stability AI CEO 站台。它性能强、可扩展,GAIA 跑分亮眼,团队认为未来是 Agent 群的天下,还计划为多领域构建开源 Agent

AI进修生
产品应用7

五一我没开电脑,但我的 Agent 团队没放假 | 如何用Hermes Agent移动办公

作者五一旅行未开电脑,但工作未停,靠Hermes Agent移动办公。介绍了其基本链路,还将Agent分工,如个人助理、内容总监等,也提到多Agent群聊协作,最后指出一人公司用Agent需明确流程、完善知识库,人要做好判断。

AI产品黄叔
推荐文章8

Agent Infra 赛道更新,一年后为 Agent 设计的基建发展如何?

过去一年,Agent 产品形态和使用方式变化大,其基建 Agent Infra 竞争格局也在变。它需解决让 Agent 更可控和接入更多能力两个问题,涉及 Runtime、Identity 等多方面,不同方向发展阶段和前景各异。

海外独角兽
开源动态8

补齐OpenClaw进化拼图!AReaL v1.0开源,智能体强化学习「一键接入」

2026 年 Agent 仍是热门赛道,OpenClaw 热度持续。但 Agent 强化学习训练缺乏成熟体系。蚂蚁和清华联合打造的 AReaL v1.0 开源,实现 Agent 一键接入 RL 训练,还革新了训练引擎,降低开发门槛。

机器之心
推荐文章8

LangChain CEO 再聊 Agent:chat 模式只是起点,Ambient Agents 才是未来

LangChain CEO Harrison Chase 和企业 Agent 平台 Dust 的 CEO Stanislas Polu 在播客中探讨 Agent 发展。他们认为 Agent 是光谱,Agentic 程度更重要;chat 模式只是起点,Ambient Agents 才是未来;还谈及多智能体系统及 AI 创业等话题。

Founder Park
新闻资讯8

斯坦福教授直播训练535B大模型,模型训练背后的「黑箱」正在被打开?

斯坦福教授Percy Liang宣布由Marin开放实验室启动训练Marin 535B - A23B模型,全程公开。过去大模型训练像“黑箱”,此次尝试让训练可观察、可讨论、可协作,引发网友关注。

机器之心