「组合策略」共找到 1053 篇相关文章
为什么给机器人装上昂贵的触觉传感器,反而让它变笨了?
伊利诺伊大学香槟分校等多校合作研究发现,当前机器人学习主流的多传感器融合算法(特征拼接)在处理任务时存在局限,给机器人加触觉数据会使抓取成功率暴跌。研究提出组合策略解决问题,经测试效果显著。
监督学习也能从错误中学习反思?!清华英伟达联合提出隐式负向策略爆炸提升数学能力
清华大学与英伟达、斯坦福联合提出监督学习方案NFT,在RFT算法基础上构造“隐式负向模型”利用负向数据训练。该策略弥合监督与强化学习差距,其损失函数梯度和GRPO在On - Policy条件下等价。
腾讯混元 x MBZUAI 港中文新研究:将纠错纳入策略空间,Search-R2 重构搜索增强推理学习方式
过去大语言模型能力提升靠参数和数据扩张,但在真实任务中此路径有局限。腾讯混元、MBZUAI、港中文联合团队提出Search - R2,将纠错纳入策略空间,抑制错误传播,在多跳推理任务中优势显著。
6位前DeepMind老将打造「AI指挥官」,一半成本刷新SOTA
6名前Google DeepMind成员创立Poetiq,搭建元系统让前沿大模型自动生成解决特定任务的策略和模型组合,降低推理成本。其Gemini 3 Pro优化技术在ARC - AGI - 2上创SOTA,成本仅为之前最优方法一半。
十二大顶尖大模型决战华尔街与量化投资
文章解读重磅论文,该研究汇聚五家顶级AI厂商十二个大模型,在标普500指数十一大板块构建投资组合并测试。结果表明,混合智能策略是稳健收益最佳路径,未来量化投资是人机和量化模型三元融合。
LLM的快速、慢速与工具增强思维模式综述
大型语言模型在不同任务中对推理策略需求差异大,策略选择不当会影响效率与可靠性。本文提出双重知识边界框架,梳理LLMs推理模式,将策略选择形式化,还分析了决策因素及策略选择机制。
只要强化学习1/10成本!翁荔的Thinking Machines盯上了Qwen的黑科技
新智元报道,翁荔的Thinking Machines研究同策略蒸馏策略,能以1/10强化学习成本,结合同策略训练优势与密集奖励信号。该策略受DAGGER启发,扩展Qwen3团队工作,可在Tinker复现,还能用于个性化和持续学习。
Claude Code + GLM-4.5,最强性价比编程组合教程首发
7月国产开源大模型竞争激烈,智谱发布的GLM - 4.5刷新开源大模型编程和agent能力。它成本低、速度快,还能与Claude Code配合。文章介绍该模型特点,分享二者使用教程及原型设计、网站开发等实测案例。
一家营收千亿美元的公司,如何回应 AI 落地的策略问题
2025年9月19日,Qwen3和DeepSeek v3.1上线Amazon Bedrock。该产品秉持“Choice Matters”理念,为不同业务选适配基础模型,上架超二百余款模型。亚马逊云科技副总裁总结选模型要点,其策略影响AI落地进程。
Agent 走向具身世界:从语言智能到机器人「大脑指挥官」
华为诺亚方舟实验室发布 RoboHarness 系统,解决不同策略协作问题。它将独立控制系统封装成可调度技能,由 Coding Agent 决策,还设计辅助技能和 Memory Bridge 模块,促进策略协同,推动具身智能发展。