持续强化学习」共找到 1808 篇相关文章

产品应用8

大模型API的大众点评来了:7×24小时实测,毫秒级延迟智能路由,选API必备

清程极智推出的AI Ping像大模型API领域的大众点评,用7×24小时实测数据为开发者提供参考,解决信息差和重复劳动问题。它有持续评测榜单、智能路由匹配等功能,还统一了API度量衡,推动选型从经验走向数据驱动。

量子位
产品应用8

Wan3.0正式上线千问AI平台:稳定、真实、有质感

今天,视频生成模型Wan3.0正式上线千问AI平台。它在多维度全面升级,公测以来收到大量反馈,获创作者、企业用户等好评。在多领域经检验表现出色,还持续进化,部分API限时7折,已被多平台接入。

阿里云开发者
算法论文8

AAAI 2026|AP2O-Coder 让大模型拥有「错题本」,像人类一样按题型高效刷题

在AI辅助Coding技术发展背景下,开源大语言模型生成代码有运行错误。上交博士团队提出AP2O方法,构建AP2O - Coder框架,借鉴人类学习模式,经实验验证能提升模型性能、抑制错误、提高样本效率,还适配通用模型。

机器之心
产品应用7

C3仓库AI代码门禁通用实践:基于Qwen3-Coder+RAG的代码评审

本文介绍C3仓库基于Qwen3 - Coder+RAG的代码评审实践,在CI流水线监听代码修改触发AI评审,可发现逻辑风险、拦截高危缺陷。该实践能提升评审效率与质量,可复用于代码门禁平台或辅助编程工具,当前仍在持续优化。

阿里云开发者
开源动态8

最强开源机器人大脑!蚂蚁两万小时真机数据开启物理AI缩放定律

蚂蚁集团开源具身智能基座模型LingBot-VLA,用两万小时真机数据证明机器人学习有缩放定律且未达瓶颈。该模型优势显著,在多平台表现出色,团队还从数据、架构、工程等方面进行优化,并开源代码等加速行业探索。

AIGC开放社区
产品应用7

央企怎么做超级智能体?对谈中电信天翼AI:自研模型为底座,自主规划是必须,能适应千行百业才行

中国电信天翼AI发布星辰超级智能体,获2025企业级AI Agent榜单央企第一。它依托自研“星辰大模型”,具备全模态、复杂推理等能力。访谈专家指出智能体可直接产出应用,落地需嵌入主业系统,电信持续迭代模型优化它。

量子位
新闻资讯7

估值7亿美元!OpenAI前高管杀进工厂,要给流水线装上AI大脑

2024年硅谷经历OpenAI高管离职潮,前首席研究官Bob McGrew联合创办Arda,将AI带入制造业工厂。Arda以7亿美元估值融资7000万,开发视频模型让机器人自主学习,统筹生产线的人与机器。不过,制造业引入AI面临挑战。

新智元
新闻资讯7

人形机器人设计正在向仿真器低头!40年机器人从业老兵发出警告

人形机器人行业现怪象,为让仿真系统和强化学习更顺,一些有机械优势的结构因‘仿真麻烦’被排除。40多年经验的Scott Walter质疑设计变得‘S.T.U.P.P.I.D.’,指出仿真应服务设计而非主宰。

机器之心
推荐文章8

大厂CIO独家分享:AI如何重塑开发者未来十年

阿里云智能集团副总裁、CIO蒋林泉分享AI时代开发者发展。他指出不能用旧有标准评判价值,探讨技术贡献衡量、全栈工程师、提效顺序等问题,强调AI可助力学习和角色创新,还提及招人看重的能力和心性。

InfoQ
算法论文7

Meta|提出RECAP,通过动态目标重加权回放,解决RLVR遗忘【文末送书!Agent相关】

近年来,可验证奖励强化学习(RLVR)提升了大模型在多任务上的性能,但带来“能力退化”问题。Meta等提出RECAP策略,结合“回放”与“动态目标重加权”,保持模型通用能力,提升推理性能,还提高推理效率。

AINLPer