训练阶段」共找到 2586 篇相关文章

新闻资讯7

5Y News | AI-native投资管理公司GIM完成数千万美元A轮融资

近日,AI-native智能投资管理公司GIM完成A轮数千万美元融资,由弘毅投资旗下金涌投资和B Capital联合领投。公司沿着垂域大模型和自进化智能体系统两条主线建设资管基础设施,已进入实战阶段

五源资本 5Y Capital
算法论文8

拿着做数学题的 PRM 来评判 Agent 调用工具,基本是行不通的!

目前评估体系多为结果导向,在工具调用上缺乏像样的PRM基准。Arizona State University和Intuit AI Research研究者推出ToolPRMBench,指出用做数学题的PRM评判Agent调用工具行不通,还介绍了其构建方法、训练范式和实验结果。

深度学习自然语言处理
开源动态8

清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座

清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。

AIGC开放社区
开源动态8

阿里开源DeepResearch模型,超强“AI研究员”,开启自主智能体新纪元

阿里巴巴通义实验室开源Tongyi DeepResearch模型,是全球首个性能能与OpenAI DeepResearch较量且全开源的Web Agent。它采用先进架构,有两套推理范式,训练方法论有创新,实测表现佳,应用场景广,用Apache - 2.0许可证。

AIGC开放社区
新闻资讯8

梁文锋执笔的R1论文登上Nature封面!首次回应外界三大质疑

9月17日,DeepSeek创始人梁文锋通讯作者名义发表的DeepSeek - R1论文登《自然》封面。该模型借助强化学习自主形成推理能力,在Hugging Face下载量破1090万次。新版论文回应质疑,披露训练细节,虽有不足但引发学界关注。

InfoQ
算法论文8

字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限

强化学习虽提升大语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在多数学推理基准实验中显著优于强基线,为大模型强化学习提供新范式。

量子位
开源动态8

性能提升84%-166%!L-Zero仅靠强化学习解锁大模型探索世界的能力 | 已开源

招商局狮子山人工智能实验室团队用RLVR让模型“自学”,构建L0系统,含NB - Agent框架和端到端强化学习训练流程,开源相关内容。测试显示L0显著提升模型性能,展现强大泛化能力。

量子位
推荐文章7

AI 原生软件工程的可观测性与可控制性

文章指出 AI 成研发主力军,改变软件生产方式,传统研发管理办法需升级。当前人和 AI 协作有诸多问题,介绍了研发三阶段,阐述可观测性与可控制性概念、关键指标,以及实现可控制性的要素,强调二者结合构建高效研发体系。

InfoQ
产品应用7

千问 APP 再更新:为什么说「聊天」并不是 AI 产品的终点?

当前AI市场进入场景战役阶段,头部玩家都在去聊天化。千问APP此次升级,可在同一界面内完成办公场景从需求到成品的全流程,还覆盖多种模板,引入智能编辑器,是务实且有意义的探索。

刘言飞语
算法论文8

LLM的下一战:从狂卷数据到精算数据

大模型竞争核心正从比拼数据规模转向数据使用效率和风险管理。文章分享2025两篇论文,介绍高效训练和机器遗忘两赛道,前者有数据价值飞轮5大模块,后者提出三时段分类法、三层次遗忘及评价指标全景。

PaperAgent