「协同强化学习」共找到 1846 篇相关文章
深度访谈:阿里云X平头哥,模型推理提升13倍背后的秘密
这篇深度访谈聚焦阿里云与平头哥,探讨模型推理提升13倍背后的秘密。随着AI焦点转向推理,行业面临算力、成本、监管等矛盾。嘉宾分析推理范式现状与变化,探讨推理加速技术及优化策略,还谈及瓶颈、未来发展及竞争方向。
企业级靠谱龙虾升级,拒绝失控
OpenClaw爆火又降温,凸显轻量化智能体短板,企业需具精准业务理解和多技能协同能力的AI员工。滴普科技升级Deepexi企业大模型,其与两平台构成DeepexiOS,支撑企业AI体系化建设。
卡帕西:编程从写文件变成管龙虾!IDE不会凉但得换个用法
AI Coding先锋卡帕西认为,虽AI能生成大部分代码,但IDE不会被淘汰,编程玩法变了,开发工具需进化,功能要从组织文件变为高效协同智能体,还给出了新一代IDE应具备的技能。
12小时登顶OpenAI MLE-bench!上海AI Lab开源算法进化框架MLEvolve
上海AI实验室开源算法进化框架MLEvolve,12小时登顶OpenAI MLE - bench榜单第一。它是自进化机器学习系统,在75道Kaggle竞赛题上奖牌率达61.33%,为AI自主算法设计提供新方案。
万字拆解:Manus 的 PMF 到底是什么,以及谁在为它一直买单?
本文深入剖析 Manus,探讨其 PMF。分析其使用场景、产品价值,对比与 ChatGPT 差异,勾勒核心用户画像,还发现 AI 工具分工、用户消费特点等,指出 AI 竞争关键,阐明 Manus 边界与行业机会方向。
Meta&UIUC大发现:无需标注,Agent复杂的工具使用和搜索能力,是可以“无中生有”的
Meta和UIUC研究发现,无需标注,Agent复杂工具使用和搜索能力可“无中生有”。论文Dr. Zero让大模型自我博弈成搜索专家,用HRPO提效,设计难度导向奖励,实验表现佳,但也存在局限。
Anthropic 再发长文:首次详细揭秘Agent的评估全过程「Claude code开发过程的经验总结」
Anthropic在Claude Code等开发及与客户合作中总结出AI Agent评估方法。文章介绍评估基本结构、构建原因、评分器类型、不同Agent评估法、应对不确定性指标、构建路线图及与其他方法协同方式。
智元首发SOP系统:打破离线训练瓶颈,让具身智能在“干中学”
2025年VLA让机器人有通用性,但真实部署存问题。智元机器人具身研究中心提出SOP在线后训练系统,融合在线学习等,使机器人在真实环境持续进化,实验显示其能提升性能、效率,突破VLA瓶颈。
NeurIPS 2025 Best Paper | 扩散模型不为人知的“时间差”:为什么先学会创作,后学会抄袭?
深度学习中,扩散模型能生成新图像且抗过拟合。巴黎高师和博科尼大学研究团队论文指出,这源于隐含的动力学正则化,训练分两阶段,数据量增加会拉开‘泛化窗口’,还给出数学解释。
国际头部高校联名发布 Agentic AI 的真正进化论
目前从‘LLM’向‘Agentic AI’跃迁,Agent实操能力不足。论文《Adaptation of Agentic AI》梳理领域情况,提出2x2象限框架,介绍优化Agent及工具的方法,还提及局限和未来方向并给出战术建议。