RL 优化技术」共找到 4011 篇相关文章

算法论文8

SearchAgent-X: 打破效率桎梏,释放下一代「AI搜索智能体」的真正潜能

论文提出SearchAgent-X框架解决AI搜索智能体效率难题。研究剖析效率瓶颈,发现精度和延迟问题,提出优先级感知调度与无停顿检索技术,经评估大幅提升性能且不牺牲答案质量。

PaperAgent
新闻资讯7

Claude 4如何思考?资深研究员回应:RLHF范式已过,RLVR已在编程/数学得到验证

Anthropic两位研究员在博客采访中透露Claude 4思考细节。提到可验证奖励强化学习RLVR在编程和数学领域获证明,探讨了RL扩展、模型自我意识等,还为大学生给出AI领域建议。

量子位
算法论文8

Qwen突破:用「并行计算」代替「堆参数」,新方法内存降22倍、延迟降6倍

LLM进化依赖「堆参数」,存在训练成本高、推理慢等问题。论文提出ParScale,用「并行计算」代替「堆参数」,让模型「分头思考」,推理效率提升22倍,旧模型也能改造,落地价值大。

深度学习自然语言处理
新闻资讯7

突发!OpenAI正与微软洽谈新融资,筹备IPO

金融时报消息,OpenAI和微软正重新洽谈数十亿美元合作条款,为OpenAI筹备IPO,同时保护微软对前沿AI访问权。双方还在修订2019年合同,微软提议放弃部分股权换新技术访问权。

AIGC开放社区
推荐文章7

“光靠人盯不住了”!拆解上万张晶圆,这家公司靠AI将芯片良率提升数个百分点

喆塔科技创始人赵文政称国内跑通AI的半导体工厂少,工业AI尚处发展阶段。喆塔将DeepSeek接入自研大模型,提升训练效率。还分享了团队实例,强调工业AI决胜点在行业知识。此外,介绍了喆塔切入AI领域的过程、应用成果、面临挑战及未来策略等。

AI前线
推荐文章9

AI虚拟细胞是什么?一篇报告说清楚

本文是《麻省理工科技评论》中国发布的AI虚拟细胞(AIVC)调研报告介绍,梳理AIVC的技术框架、产业生态、发展趋势与应用前景,指出AIVC有望革新药物研发流程,压缩研发成本与周期。

DeepTech深科技
算法论文9

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

针对原生视觉推理缺少完整训练评估基础设施的现状,NTU等多校联合推出VBVR-Pro系统,构建了从任务构建、模型训练、能力评测到强化学习优化的完整闭环,论文、数据、代码均已公开。

机器之心
新闻资讯8

从李飞飞到朱军,世界模型为什么都开始走向机器人|甲子光年

本文报道近期多位AI领军者均将世界模型研究转向机器人领域,梳理了朱军团队通用世界模型的五级技术路线,解析世界模型从生成世界走向真实行动的核心逻辑与行业趋势。

甲子光年
开源动态8

机器人进入“边做边学”时代:星尘发布在线强化学习框架,让动态投掷成功率提升超141%

星尘智能基座模型团队公布在线强化学习框架SmoothRL,解决异步执行环境中具身模型在线微调难题。该框架让策略更新对应硬件实际执行,攻克延迟失准问题,在多项真机测试中大幅提升任务成功率。

AI前线
开源动态7

马斯克点赞的APP来了!刚下场视频世界模型,就拿下评测第一

实时视频世界模型成热门,Loopit发布的实时互动世界模型Zing - 0.5在评测中获第一且已开源。该公司提出独特观点,认为实时视频非世界,互动应“模应一体”,还指出抵达端到端终局的新路径。

新智元