奖励设计」共找到 1506 篇相关文章

新闻资讯7

2025 智谱 Z DemoDay :24 家值得关注的 AI 创企,看看今年创业都在做什么?

8月31日,星连资本、智谱Z计划主办的Z DemoDay举办,24个早期AI项目亮相,覆盖多领域。路演外还有产品创造营,围绕AI产品设计研讨演练。大会还设创意活动,揭示AI时代创新本质是人类创造力。

Founder Park
算法论文8

大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO

本文介绍了大型语言模型稳定强化学习新路径——几何平均策略优化GMPO。它是GRPO稳定化版本,通过优化几何平均替代算术平均,解决GRPO训练不稳定问题,在多任务实验中显著优于GRPO。

机器之心
开源动态8

一句话复刻谷歌!我用智谱新开源的GLM-4.5,把Agent开发打回了简单模式。

智谱AI深夜发布开源的新一代旗舰模型GLM - 4.5,目标成为最强Agent基座。它能一句话复刻搜索引擎,多能力原生融合,在多项测试中表现出色,推理快、价格低,还通过多关压力测试,且开源成本低。

探索AGI
算法论文8

机器人高层指挥低层做,“坐标系转移接口”一次演示实现泛化学习 | ICML2025

美国东北大学和波士顿动力RAI提出HEP框架,首创“坐标系转移接口”,有极简高效分层结构、空间对称性自然泛化、创新型体素编码器等亮点。它基于分层策略和接口,提升机器人操作灵活性与泛化性,论文被ICML2025收录。

量子位
算法论文8

突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的多轮强化学习框架MGPO

先进多模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的多轮强化学习方法MGPO,能让模型精准推理,还可使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。

机器之心
推荐文章8

AI智能体的上下文工程:Manus的构建心得

季逸超在文章中分享了 Manus 构建 AI 智能代理的心得,包括围绕 KV 缓存设计、使用掩码管理工具、将文件系统作上下文等内容,还指出要保留错误信息、避免小样本带偏等。

AI工程化
新闻资讯8

重大技术突破!微软发布BioEmu模型,蛋白质模拟从数年压缩至几小时

今天凌晨,微软CEO分享蛋白质模拟模型BioEmu,可将蛋白质动态模拟从数年缩至几小时,已在《自然》发表。它能解决传统方法难题,核心设计独特,训练整合多数据源、采用多阶段策略。

AIGC开放社区
新闻资讯7

OpenAI将发布AI Agent浏览器,挑战谷歌Chrome

路透社消息,OpenAI将在未来几周发布AI Agent驱动的网络浏览器,或挑战谷歌Chrome。其设计让部分交互在聊天界面完成,还能整合产品自动执行任务,不过也面临激烈竞争。

AIGC开放社区
新闻资讯7

Meta为他豪掷2亿美元,上交校友庞若鸣,晒出在苹果的最新论文

苹果基础模型团队负责人庞若鸣即将加入Meta,Meta为其开出2亿美金天价。7月9日庞若鸣宣传在苹果参与的研究《AXLearn: Modular Large Model Training on Heterogeneous Infrastructure》,介绍了AXLearn系统优势、架构、实验评估等。

机器之心
算法论文8

推荐大模型来了?OneRec论文解读:端到端训练如何同时吃掉效果与成本

随着AI发展,推荐系统面临诸多问题,快手技术团队提出OneRec,以端到端生成式架构重构推荐系统全链路,在效果与成本上实现突破,已在快手双端服务用户,也有需完善之处。

机器之心