强化方案」共找到 1488 篇相关文章

产品应用7

求稳的安全IP,安谋科技如何守正出奇?|甲子光年

12月24日,安谋科技推出新一代SPU IP——“山海” S30FP/S30P,给出面向高性能计算芯片的全栈安全解决方案。该方案从硬件IP层、软件中间件到云端服务构建一栈式安全防护体系,有五大核心亮点。

甲子光年
算法论文7

Meta|提出RECAP,通过动态目标重加权回放,解决RLVR遗忘【文末送书!Agent相关】

近年来,可验证奖励强化学习(RLVR)提升了大模型在多任务上的性能,但带来“能力退化”问题。Meta等提出RECAP策略,结合“回放”与“动态目标重加权”,保持模型通用能力,提升推理性能,还提高推理效率。

AINLPer
算法论文8

让机器人「不仅会想,还能准确去做」,VLA-R1把「推理+行动」带进真实世界

VLA-R1是“先推理、后执行”的VLA基础模型,结合链式思维监督与强化学习,优化推理和执行。它有两阶段训练、三类可验证奖励等创新点,经多层面测试效果好,在多领域有应用前景。

机器之心
推荐文章8

从混沌到可控:企业应用中AI Agent不确定性控制的 10 种策略

大语言模型输出的不确定性限制了AI智能体在企业场景的应用,本文总结控制生成式AI Agent不确定性的常见策略,涉及技术、应用设计、管理与治理层面,还推荐了相关作品。

AI大模型应用实践
产品应用8

阿里发布Qwen3-TTS:跨语言混合无缝切换,方言音色全面覆盖!

TTS技术从单一合成进化到多模态表达,但传统模型在跨语言/方言混合场景有不足,商业工具费用高且不开源,开源方案训练数据少。阿里推出Qwen3 - TTS,实现人类级自然度和表现力,功能强大,应用场景多。

开源星探
新闻资讯7

Mira Murati 创业公司首发长文,尝试解决 LLM 推理的不确定性难题

OpenAI前CTO Mira Murati创立的Thinking Machines Lab首发文章《克服LLM推理中的不确定性》,指出大语言模型推理难获可复现结果,深入探究其不确定性根源,提出使核函数具备批次不变性的方法并给出实现与实验。

Founder Park
产品应用7

用最简单的大模型技术打造一个迁云专家有多难?

文章探讨在云迁移领域用大模型技术“复制”专家80%核心能力。分析标准化方案不足及简单RAG局限,介绍“LX0.1”AI专家助手构建,还提及分层评测、人机协同等优化,最后展望AI在云迁移的未来方向。

阿里云开发者
算法论文7

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。

机器之心
新闻资讯7

5Y News|赜灵生物完成近4亿元B+轮融资

近日,赜灵生物宣布完成近4亿元B+轮融资,由启明创投领投。资金用于推进创新药临床研究和拓展新管线,强化三大核心技术平台。公司已有核心产品进入关键临床阶段,创始人称2025年将加速海外布局。

五源资本 5Y Capital
新闻资讯7

独家 | 腾讯X Lab 韩磊即将离职,将加入诺亦腾科技

AI 科技评论独家获悉,腾讯具身智能技术中心副总经理韩磊 7 月底离职,将加入诺亦腾科技。韩磊在多智能体强化学习成果多,其参与研究登上《Nature Machine Intelligence》2024 封面,加入诺因该司有大量动捕数据。

AI科技评论