A3C算法」共找到 2511 篇相关文章

算法论文8

华为发布如何利用RL训练强大的Deep Research Agent综述!

华为技术团队发布综述论文,首次系统性梳理利用强化学习(RL)训练强大的深度研究代理。论文指出传统SFT和DPO方法有局限,RL优势明显,还在数据构建、算法设计等方面给出进展与路线图。

深度学习自然语言处理
算法论文8

博士答辩PPT分享 | 高雷诺数湍流场数据同化与湍流模型机器学习研究

西北工业大学孙旭翔博士的论文聚焦航空航天湍流模拟难题,结合数据驱动与同化方法,构建全流程框架,提出数据同化与模型修正方法,设计集成框架,实现高雷诺数复杂流动精确高效模拟。

力学与人工智能
新闻资讯7

闹玩呢!首届大模型对抗赛,DeepSeek、Kimi第一轮被淘汰了

谷歌发起首届大模型国际象棋对抗赛,为期三天。参赛模型众多,首轮中 Gemini 2.5 Pro、o4 - mini、Grok 4 和 o3 以 4 - 0 战绩晋级半决赛,DeepSeek、Kimi 首轮被淘汰,目前 Grok 4 是夺冠热门。

机器之心
推荐文章8

构建会“说话”和“行动”的 AI:生成式数字人技术与 EchoMimic 实践

在 QCon 全球软件开发大会上,支付宝李宇明围绕 EchoMimic 介绍生成式数字人进展、技术、应用及研究思路。对比传统数字人,生成式数字人成本低、易控制,但也有技术新、推理成本高的问题。EchoMimic 两版本已开源,经优化推理速度可提升。

InfoQ
产品应用8

国内首个免费提供的深度研究,反而有市面上最好的体验

秘塔深度研究(https://metaso.cn/)上线,是首个将深度研究作免费基础功能的产品。它在算法、交互等多方面优化,降低成本、保障准确,还创新交互形式,搜索结果清晰有条理,体验佳。

歸藏的AI工具箱
新闻资讯7

7B小模型超越DeepSeek-R1:模仿人类教师,弱模型也能教出强推理LLM | Transformer作者团队

Transformer作者之一创立的Sakana AI带来新方法,让教师模型像人类教师一样做启发式教学,根据已知解决方案输出解释。用此方法训练的7B小模型在传授推理技能上比671B的DeepSeek - R1更有效。

量子位
算法论文8

监督学习也能从错误中学习反思?!清华英伟达联合提出隐式负向策略爆炸提升数学能力

清华大学与英伟达、斯坦福联合提出监督学习方案NFT,在RFT算法基础上构造“隐式负向模型”利用负向数据训练。该策略弥合监督与强化学习差距,其损失函数梯度和GRPO在On - Policy条件下等价。

量子位
推荐文章7

智能投顾的大模型应用,为什么选择了“大小模型协同”?

大模型时代,金融智能投顾落地是技术与业务安全的双重挑战。北银金科高级算法专家尹辰轩表示采用“大小模型协同”架构,能在性能、准确性与合规间找平衡,还阐述了架构亮点、问题解决办法等。

InfoQ
算法论文7

LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%

最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。

新智元
开源动态8

1.7K star!找到啦,小众需求,但是需求的时候你一定用得上,企业级能源管理神器

MyEMS是开源能源管理系统新标杆,基于Python+Django构建,提供完整解决方案。支持多场景能耗监控,通过可视化报表和AI算法优化能效,助企业降15%-30%能源成本,还介绍了其功能、架构等。

小华同学ai