任务级奖励」共找到 2929 篇相关文章

推荐文章8

投奔小扎,Jason Wei连发两篇博文公布“屠龙术”:一个公式看透AI,一条心法指引人生

OpenAI研究科学家Jason Wei被小扎挖走后连发两篇文章。一篇提出“验证者定律”,指出训练AI解决任务难易与可验证性成正比;另一篇从强化学习悟到人生要走On - Policy路线,发挥自身优势。

AI寒武纪
算法论文8

最新12种GraphRAG技术全面评测

6月两篇论文对12种GraphRAG技术评测。GraphRAG通过构建图结构组织知识,在复杂推理等任务中优于传统RAG。不同GraphRAG技术在图构建、知识检索上表现各异,如RAPTOR图构建慢但令牌消耗少。

PaperAgent
产品应用7

Claude Code 新功能 Agent Teams:4 类活效率翻倍,4 类活纯烧 token

Claude Code v2.1.32 后新增实验性功能 Agent Teams,可将其从单个 AI 助手升为 AI 团队,但会使 token 用量线性放大。文章总结了适合和不适合用此功能的任务类型,还给出决策清单、实战避坑建议。

AI Reading Hub
产品应用8

最强编码模型 Fable 5.1 发布:性能翻倍、Agent 成本降 45%,Anthropic 把顶模型送进真实世界

当地时间9月1日,Anthropic发布Claude Fable 5.1和Claude Mythos 5.1,新模型在多方面能力提升,Agent工作负载成本最高降45%,此次发布还涉及价格、数据留存等多方面内容,争夺高价值任务市场。

InfoQ
算法论文7

预测下一个像素还需要几年?谷歌:五年够了

谷歌DeepMind研究者分析下一像素预测在图像识别与生成任务中的扩展特性。实验显示其扩展趋势与文本类似但效率低,最优策略因任务和分辨率而异,预计未来五年逐像素建模可行。

机器之心
算法论文8

ICML 2025 | 西湖大学吴泰霖研究员团队:组合生成式多物理场多元件PDE仿真

西湖大学吴泰霖课题组联合多方提出“组合生成式多物理场多元件PDE仿真(M2PDE)”,将仿真问题视为生成式概率建模任务。该成果在多任务测试中表现卓越,被ICML 2025接收。

力学与人工智能
开源动态8

AI记忆革命爆发!Clawdbot如何像大脑般记住一切

2026年初开源个人AI助手Clawdbot引爆社区。它可本地运行、集成聊天平台、自主处理任务,有长时记忆和任务执行能力。AI研究工程师Manthan Gupta复盘其记忆机制原理,涉及上下文、记忆存储、搜索等内容。

新智元
新闻资讯8

OpenAI 发布GDPval,可真实评估现实世界经济价值。Claude Opus 4.1 拿下第一

OpenAI推出GDPval,可评估AI在真实经济价值任务上的表现。它从9个行业选44种职业,设1320个真实任务。Claude Opus 4.1表现最佳,前沿模型速度快、成本低。OpenAI计划扩展GDPval,还开源部分内容。

AGI Hunt
算法论文7

UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习

视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。

机器之心
新闻资讯7

全球95%企业AI惨败?MIT报告引硅谷恐慌!90%员工偷用ChatGPT续命

MIT报告《The GenAI Divide: State of AI in Business 2025》指出,95%企业AI试点项目失败,但90%员工用ChatGPT等个人AI工具办公。消费工具因灵活易用胜企业,企业应向员工学习,与供应商合作。摩根士丹利报告称AI可为企业省成本。

新智元