流中强化学习」共找到 2766 篇相关文章

算法论文8

ICML 2026 | Agentic强化学习训练的信息自锁问题

随着大语言模型走向真实交互,强化学习训练LLM agents时出现信息自锁问题。香港文大学等研究者分析其原因并提出AREW方法,在多场景实验表现稳定且具鲁棒性。

机器之心
产品应用8

全球第二、国内第一!钉钉发布DeepResearch多智能体框架,已在真实企业部署

在数字经济浪潮,企业对高效信息获取与决策支持需求迫切,但现有研究系统存在不足。阿里巴巴钉钉团队提出Dingtalk - DeepResearch多智能体框架,在评测成绩优异,已在真实企业场景部署。

机器之心
新闻资讯7

OpenAI有个神秘邮箱,多大点事都能惊动奥特曼

OpenAI扩张启用friction机制,员工遇问题可发邮件到friction@openai.com,重要问题能惊动高层。该机制由Fidji Simo制度化,虽有人不满,但在竞争利于消除内部堵点,对手也各有管理法。

机器之心
算法论文8

让LLM扔块石头,它居然造了个投石机

大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。

量子位
新闻资讯7

刚刚,LMArena最新模型榜单出炉!DeepSeek-R1网页编程能力赶超了Claude Opus 4

LMArena最新模型榜单出炉,DeepSeek - R1(0528)表现亮眼。在文本基准测试整体排第6、开放模型排第一,细分领域也成绩优异,在WebDev Arena平台与闭源大模型并列第一,超Claude Opus 4。

机器之心
算法论文8

你敢把「龙虾」放在手机上跑吗?手机 Agent 离落地还差一道「隐私关」

深联合腾讯混元研究揭示,手机 Agent 落地关键不在成功率,而在隐私边界。研究设计隐私交互协议,构建模拟 App 记录过程,将常见越界行为归类检查,评估多个模型发现诸多隐私问题。

AI科技评论
开源动态8

机器人进入“边做边学”时代:星尘发布在线强化学习框架,让动态投掷成功率提升超141%

星尘智能基座模型团队公布在线强化学习框架SmoothRL,解决异步执行环境具身模型在线微调难题。该框架让策略更新对应硬件实际执行,攻克延迟失准问题,在多项真机测试大幅提升任务成功率。

AI前线
新闻资讯7

他想让TPU成为AI界的X86!

2026世界人工智能大会期间,昊芯英主办分论坛,新一代全自研TPU架构AI芯片“须臾®”亮相,华东地区首个国产TPU智算千卡集群落成。“须臾®”算力强、成本低,集群全链路国产化,昊芯英探索TPU突围路径。

芯师爷
算法论文8

用“因果规划”解决多智能体协作的任务依赖难题|港科广&腾讯

港科广和腾讯研究团队提出CausalMACE方法,将因果推理机制引入开放世界多智能体系统。该方法含全局因果任务图,框架分“判断”“规划”“执行”环节,在基准任务表现出色,已稿EMNLP 2025 Findings。

量子位
算法论文8

ICLR 2026 Oral|大模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升

以DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试实现推理长度减半且性能提升。

机器之心