智能体强化学习」共找到 4536 篇相关文章

开源动态8

微软开源3大突破AI Agent模型,仅140亿参数超越DeepSeek-R1

微软研究院开源AI Agent推理模型rStar2-Agent,140亿参数在多测试超6710亿参数的DeepSeek-R1。其通过智能体强化学习,在训练基础、算法、流程上有三大突破,显著提升性能且降低算力成本。

AIGC开放社区
算法论文8

智能体是否在欺骗用户?上海 AI Lab&港科大&浙大揭示LLM智能体的主动隐瞒与造假现象

上海人工智能实验室等机构研究《Are Your Agents Upward Deceviers?》揭示“智能体向上欺骗”现象。智能体面临约束时会隐瞒失败、主动造假,测试11个主流大模型发现此现象跨模型存在,还探究了让智能体变诚实的方法。

深度学习自然语言处理
开源动态7

OpenClaw 之后,Agentic RL有了新训练范式

大模型技术推动AI从‘回答问题’迈向‘执行任务’,Agentic AI兴起。中国科大认知智能全国重点实验室提出Claw - R1项目,将前沿Agent Runtime与强化学习训练框架结合,为Agentic AI提供新训练基础设施。

PaperAgent
推荐文章8

企业级 Agent 多智能体架构与选型指南 -- 来自1000+行业应用实践积累

本文基于超1000+智能体应用实践经验,介绍企业级Agent多智能体架构。强调单智能体优先,介绍AgentScope支持的多智能体模式,对比工作流与对话模式,给出架构选型指南,还提及Spring AI Alibaba Graph为多智能体提供的能力。

阿里云开发者
新闻资讯8

字节 AI 卷出新高度:豆包试水“上下文定价”,Trae 覆盖内部80%工程师,战略瞄定三主线

近日字节分享 AI 技术发展三主线,6 月 11 日火山引擎有系列发布更新。豆包 1.6 实行上下文定价,成本降低;超 80% 字节工程师用 Trae;视频生成模型 Seedance 1.0 Pro 具性价比;智能体带动强化学习算力攀升。

AI前线
算法论文8

DeepMind再登Nature:AI Agent造出了最强RL算法!

Google DeepMind团队提出DiscoRL,让智能体在多环境交互中自主发现强化学习规则,无需人类设计。它在Atari基准中击败MuZero,在未见过的游戏中也稳定高效,相关研究登《Nature》。

新智元
开源动态8

腾讯混元世界模型HY-World 1.5开源,24 FPS的实时交互世界建模

腾讯混元世界模型HY - World 1.5开源,实现24 FPS实时交互世界生成。它采用双重动作表征等技术,解决了长程生成问题,还通过强化学习等优化,在多方面表现出色,为具身智能场景模拟奠基。

AIGC开放社区
算法论文8

半在线RL新范式UI-S1,使得GUI Agent既稳定又规划长远

现有AI训练方法在GUI自动化中各有弊端,本文提出半在线强化学习范式,训练出UI - S1 - 7B模型,性能提升显著,还提出新评估指标SOP,是迈向实用化AI智能体的重要一步。

深度学习自然语言处理
产品应用8

聚焦手机AI“超级入口”,中兴Nebula小模型让手机秒变“小秘”?

移动智能时代,手机AI“超级入口”成竞争焦点。美团率先推出AI Agent,中兴通讯自研Nebula-GUI模型表现亮眼,在测评中获佳绩,已在多款手机商用,还开发数据制备系统,经监督微调、双层强化学习提升性能。

量子位
推荐文章8

张小珺对话OpenAI姚顺雨:生成新世界的系统

OpenAI研究员姚顺雨在播客访谈中分享诸多新颖观点。他认为创业公司机会在设计新交互方式,未来或产生超越ChatGPT的超级应用;还指出语言是实现泛化的工具,强化学习有泛化趋势,智能边界由不同超级应用共同定义。

Founder Park