自奖励训练」共找到 3123 篇相关文章

新闻资讯7

OpenAI「辣椒芯」干翻英伟达!老黄股价不跌反涨

OpenAI研芯片「小辣椒」跑分碾压英伟达最强blackwell,低延迟、高吞吐、低并发等全达SOTA级别。但英伟达股价未跌反涨,OpenAI也表态不会弃用英伟达。「小辣椒」预计2027年量产,OpenAI还将开发后续版本,不过其数据中心负责人离职,无人接手。

量子位
新闻资讯7

AI Agent 距离真正替人「全动办公」,还有多远?

Meta、微软和 xAI 被曝监视员工操作来训练 AI,原因是真实办公中 AI Agent 表现不佳。SaaS - Bench 评测显示顶级大模型表现糟糕,智能体存在长周期任务脆弱、跨应用错误放大等问题,未来 SaaS 软件或需为 Agent 重新设计。

特工宇宙
新闻资讯7

刚刚,Anthropic在质疑声中获130亿美元融资,估值达1830亿

Anthropic完成130亿美元F轮融资,投后估值达1830亿美元。此轮融资由Iconiq等领投,多方参与。推Claude后其估值飙升,营收增长快。不过该公司也面临收集数据、用量限制等争议,却未影响投资者信心。

机器之心
算法论文8

JCP | 哈工大(深圳)胡钢团队:三维钝体流动中主动流动控制的深度强化跨域迁移学习

本文将基于相互信息的知识迁移学习与柔性动作 - 评论(MIKT - SAC)算法结合,解决主动流动控制中状态和动作维度的跨领域问题。应用于两个测试案例,结果显示该方法优于SAC算法,能显著减少训练时间、降低阻力系数。

力学与人工智能
算法论文8

李飞飞、Jim Fan和徐丹飞联合重磅论文:机器人灵巧手,可能走错了路

李飞飞等学者联合发表论文,分析当前触觉融合方案缺陷,提出 T - Rex 架构。它改变触觉输入方式,使用新编码方法和数据集,经三阶段训练,在 12 项任务评测中平均领先 30 个百分点,也指出了局限与未来方向。

DeepTech深科技
推荐文章8

智能体时代的强化学习:AReaL 框架与 Agent 最佳实践

本文整理吴翼博士在 2025 年 QCon 全球软件开发大会的分享。他介绍 AReaL 框架及 Agent 最佳实践,阐述强化学习与大模型联系,指出 Agent 是 AGI 未来 5 年关键,强化学习是 Agent 技术核心,还分享团队成果与经验。

InfoQ
新闻资讯8

GPT-5.1发布当天,文心5.0杀回来了

2025百度世界大会发布文心5.0,这一2.4万亿参数的原生全模态模型,训练之初融合多模态数据,支持联合输入输出。同日OpenAI推出GPT - 5.1,文心5.0在多方面表现出色,如情绪安抚更贴心、多模态理解能力强等。

新智元
算法论文8

仅100种子题,合成数据质量超GPT-5,阿里、上交提出Socratic-Zero框架

阿里巴巴与上交大联合提出 Socratic-Zero 框架,仅从 100 个种子问题出发,通过三智能体协同进化生成高质量课程。该框架合成数据质量超 GPT - 5 等,Solver 性能提升显著,工程友好,开启零数据进化新路径。

机器之心
开源动态8

清华开源首个股票k线大模型

清华开源首个股票K线大模型Kronos,是专为金融市场K线序列预训练的模型,处理金融数据高噪声特性。采用两阶段框架,有安装、预测步骤,还有批量预测方法,项目地址为https://github.com/shiyu-coder/Kronos。

GitHubStore
算法论文8

突破LLM数据瓶颈:Meta等提出语言我博弈,一台模型,两个角色,无限进化

Meta等团队提出“语言我博弈”(LSP)框架,让语言模型己和己“玩游戏”,在无外部数据输入下我改进。实验显示,其性能可媲美甚至超越用大量人类数据训练的模型,为缓解数据稀缺提供新思路。

深度学习自然语言处理