双模式策略优化」共找到 2002 篇相关文章

算法论文8

首次解释LLM如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

西北大学与Google、谷歌DeepMind团队质疑传统强化学习与反思的关系,提出贝叶斯自适应强化学习方法,首次解释为何、如何及何时反思探索新策略,还给出决策数学形式,实验显示其性能更优。

量子位
算法论文8

CVPR 2025 Highlight | 提升自回归模型样例学习能力,Few-shot图像编辑新范式开源

当前图像编辑模型在处理新概念时泛化能力不足,为解决此难题,Meta等研究者提出自回归模型InstaManip,创新性提出分组自注意力机制和关系正则化策略,在few - shot图像编辑任务上取得优异效果。

机器之心
算法论文8

南开 && UIUC | SearchAgent-X,打破「效率瓶颈」,让复杂「AI搜索智能体」走向现实

南开大学和伊利诺伊大学厄巴纳 - 香槟分校的研究提出SearchAgent - X框架,解决大型语言模型驱动的搜索智能体效率痛点。它剖析制约效率的原因,通过两大‘加速引擎’优化性能,实验显示效果显著。

AINLPer
开源动态7

阿里开源自主搜索AI Agent,搜论文、网站资讯无所不能

今天凌晨,阿里开源创新自主搜索AI Agent——WebAgent,具备端到端自主信息检索与多步推理能力。还介绍了WebDancer框架从数据构建到训练优化各阶段,助其完成复杂信息检索任务。

AIGC开放社区
算法论文7

SMO | 西工大宁晨伽、张伟伟等:基于共享并行神经网络架构的多精度气动融合方法

高可靠性气动数据降本增效是关键命题。本研究总结主流多精度建模方法,提出基于共享并行架构的融合策略,区分公共与私有特征,提升融合框架表征能力,还通过算例验证方法有效性。

力学与人工智能
新闻资讯7

claude 4摔碎了码农的饭碗~

昨晚Anthropic发布Claude 4系列模型,Opus 4编码能力强,SWE - bench测试成绩优,能完成7小时代码重构。Claude 4让完成日级任务的时间提前,各应用纷纷接入,部分产品有应对策略

探索AGI
新闻资讯8

12秒生成1万token!谷歌推出文本「扩散模型」Gemini Diffusion,研究员:演示都得降速看

谷歌将图像生成常用的“扩散技术”引入语言模型,推出Gemini Diffusion,12秒能生成1万tokens,速度比Gemini 2.0 Flash - Lite更快。它通过逐步优化噪声学习生成输出,目前是实验性演示,可申请体验。

量子位
新闻资讯8

刚刚,DeepMind通用科学智能体AlphaEvolve突破数学极限,陶哲轩合作参与

DeepMind发布革命性进化编码智能体AlphaEvolve,由LLMs驱动,可演化代码库、发现和优化算法。它结合LLM创造力与自动化评估,减少幻觉,在多领域应用前景大,还与陶哲轩合作探索数学应用。

机器之心
新闻资讯8

从15个研发配1个设计,倒挂成1个研发配2个设计!OpenAI设计主管:现在是有史以来 成为设计师的最佳时机

在科技行业,产品设计师与用户研究员对职业前景焦虑、满意度低,而OpenAI产品设计负责人Ian Silber认为当下是成设计师最佳时机。他与Lenny探讨AI时代设计变革,分享应对策略、人类设计师价值等观点。

AI科技大本营
开源动态8

去掉 VAE 之后,商汤用 8B 参数重新定义了开源生图的上限

商汤SenseNova U1开源后引发开发者社区关注,它基于NEO - unify架构,摒弃VAE,实现多模态理解与生成原生统一。在多项基准测试中表现出色,还针对企业办公场景优化,成为生产级任务新选择。

AI科技评论