「工具学习」共找到 3127 篇相关文章
AGI前夜重磅:RL突破模型「认知上限」,真·学习发生了!
AI研究圈争论RL能否赋予模型超越基础模型的推理能力。UC Berkeley等团队提出DELTA框架,观察到“RL grokking”现象,还设计新任务验证,提出两阶段奖励调度,总结两种模式等,为争论带来新依据。
稳定训练、数据高效,清华大学提出「流策略」强化学习新方法SAC Flow
本文介绍清华大学和CMU提出的SAC Flow新方案,可端到端优化流策略。它将流策略视作residual RNN,用GRU和Transformer结构稳定训练。在多环境测试中表现优,有稳定、快速、样本效率高的特点。
从「会说」迈向「会做」,LLM下半场:Agentic强化学习范式综述
过去LLM训练多依赖PBRFT范式,但局限明显。2025年初起,Agentic RL新范式受关注。此综述论文梳理该方向,覆盖500+研究,构建理论框架,讨论未来挑战,助LLM从「会说」迈向「会做」。
最新 AGI 暴论:强化学习的「GPT-3 时刻」实现,还需要 1 万年?
国外AI初创公司Mechanize三位创始人联合撰文称,RL或迎“GPT - 3时刻”,但需数千至上万年“模型处理任务所用时间”训练。还提出“复制训练”新范式,能磨炼模型能力,补足短板。
从辅助工具到智能决策,大模型如何改变人才选拔方式?
随着大模型应用拓展,企业人力资源管理成落地热点。阿里巴巴技术专家程鹏认为,大模型在人才选拔与培养中有效率、个性化、客观决策等颠覆性价值,也面临落地挑战,还分享应对策略等内容。
技术思辨|AI Coding:经验壁垒正在失效,工具进化重塑编程
AI飞速发展,AI Coding对传统研发模式冲击大。文章总结5个变化趋势,如专业性转移升级、效率体现为高质量专注等,还探讨AI时代开发者核心技能及经验价值,指出变革带来挑战与机遇。
从日志学习到风洞验证:构建 GPU 集群的 AI Native 稳定性闭环
文章介绍了面向新引入GPU芯片稳定性验证的AI Native治理体系“算力风洞”。其通过厂商环境自动复刻等手段,将新芯片适配效率提升10倍以上。体系分认知、验证、进化三层,形成完整闭环,推动智算集群稳定性建设升级。
ICLR 2026 Workshop二轮征稿开启:聚焦终身智能体的学习、对齐、演化
人工智能进入转折点,AI Agent 崛起但存在瓶颈。ICLR 2026 会议期间的 Lifelong Agent Workshop 将深入探讨相关问题,推动终身智能体研究范式,现开启二轮征稿。
MiniMax Agent 开年更新,好的 AI 产品,需要让工具来适应人了
2026年初,Claude Cowork引发关注,开源社区跟进,Anthropic下调功能价格。MiniMax升级Agent,推出桌面端和网页端新功能。通过整理文件、翻译、小红书内容流水线等测试,展现其能力与局限,指出Agent应适应人的趋势。
Agentic-KGR:通过多智能体强化学习实现知识图谱的协同演化
文章指出静态知识库有覆盖缺失、时效滞后、建用分离问题。介绍 Agentic - KGR 创新点,如动态 schema 扩展等。实验显示其在图谱抽取和下游 QA 任务有提升,还呈现训练动态和图谱质量可视化结果。