两阶段训练」共找到 3089 篇相关文章

算法论文8

训练,解锁Agentic智能!微软:只需给LLM一台电脑

人大、MSR、清华的LLM - in - Sandbox开启「通用代理智能」新范式,把大模型放进“虚拟机”,让其在6大任务上成绩全线暴涨,零额外训练解锁“通用代理智能”,还介绍了相关实验、优化及效率情况。

PaperAgent
算法论文7

DeepSeek连发篇论文背后,原来藏着一场学术接力

2026年1月,DeepSeek连发篇论文,一篇解决信息稳定流动,另一篇聚焦知识高效检索。研究发现其与字节Seed团队存在“接力”,如mHC改进字节Seed的HC,Conditional Memory引用多项工作,梳理关系能助理解论文与架构创新方向。

机器之心
算法论文8

别再手写 Skill 了!微软最新研究:像神经网络一样训练 Skill

微软研究提出 SkillOpt 方法,把 Skill 文档当「权重」训练,在 52 个测试组合中全部最优或并列最优,平均提升 23.5 分,碾压人类手写。该方法跨模型、环境有效,已开源,使用方便。

AGI Hunt
算法论文8

训练加速61倍!陈怡然团队新作DPad:仅关注「彩票token」

杜克大学陈怡然团队新作DPad,发现扩散大语言模型关注少量「中奖」token,推理速度可提61 - 97倍,还增强模型语境学习能力。DPad免训练零成本挑关键信息,实现「少算多准」。

新智元
开源动态8

EmbodiChain开源,用100%生成式数据自动训练具身智能模型

跨维智能开源EmbodiChain,它是通往GS - World的基石,重构具身智能学习范式。其以100%生成式仿真数据训练机器人,突破数据瓶颈,还对比了不同路线,测试显示其模型效果佳。

机器之心
算法论文8

如何训练VLA?丰田研究院发布史上最大实验规模「保姆级」教程

丰田研究院和清华大学发布教程,用大量数据训练89个策略模型并验证。聚焦Co - training,研究五大模态、三种策略,对比不同架构,揭示有效和无效模态,还探讨CoT推理及多方面实验。

机器之心
新闻资讯7

周反转:Anthropic「闪电」夺回被Cursor挖走的核心编程大将

本月初 Anthropic Claude Code 位负责人被 Cursor 开发商挖走,周后又被聘回。Anthropic 虽烧钱但赚钱能力变强,投资人愿超千亿美元估值投资。Claude Code 增长快,而 Cursor 更新引不满,用户外流。

机器之心
开源动态8

华为推出软工代码智能体SWE-Lego,解锁SFT训练极致性能

华为研究团队推出仅基于监督微调(SFT)的软件工程代码智能体SWE-Lego,无需复杂RL流程,在SWE-bench Verified基准中表现出色,项目已开源。它有数据、训练和测试时扩展三大创新。

机器之心
新闻资讯7

瑞识科技获海外家激光雷达上市公司VCSEL芯片开发项目

近日,瑞识科技与家纳斯达克上市激光雷达企业合作,为其新一代产品定制高性能VCSEL芯片。当下激光雷达市场升温,VCSEL替代EEL趋势显著。此次合作彰显“中国芯”实力,将加速激光雷达商用。

芯师爷
新闻资讯7

彻底封杀!Anthropic第四刀砍向龙虾,开发者哀嚎,大创始人互喷!

前天Anthropic封杀OpenClaw订阅额度后,24小时内又在官方轻量化命令行工具查人,提示词含“OpenClaw”就返回400错误。大负责人隔空交火,开发者各寻出路,这或成Anthropic战略失误。

鲸选AI