带可验证奖励的强化学习」共找到 1547 篇相关文章

新闻资讯8

陶哲轩:AI 已经把想法成本降到几乎为0了...

著名数学家陶哲轩在与播客主持人Dwarkesh Patel的对谈中分享使用AI一年后的观点,认为AI已将想法生成成本降至几乎为零,但验证和评估成新瓶颈,还探讨其对数学研究的影响及未来发展。

AI寒武纪
推荐文章8

张小珺对话OpenAI姚顺雨:生成新世界的系统

OpenAI研究员姚顺雨在播客访谈中分享诸多新颖观点。他认为创业公司机会在设计新交互方式,未来或产生超越ChatGPT的超级应用;还指出语言是实现泛化的工具,强化学习有泛化趋势,智能边界由不同超级应用共同定义。

Founder Park
新闻资讯7

Kotoko AI 乔海鑫:C.Al 的故事已经结束,我们用 OC 链接 05后

本文是对Kotoko AI创始人乔海鑫的访谈。他认为OC市场潜力大,Gacha Life验证了其市场需求。Bside是融合UGC与游戏化玩法的OC社交互动平台,6月将在Steam新品节上线Demo,7月开启Early Access。乔海鑫还探讨了OC商业化、AI应用等问题。

Founder Park
新闻资讯7

刚刚,1122人干出“国产GPU”第一股,摩尔线程成功IPO:开盘股价疯涨,市值破2800亿!专家:国产AI芯片商业化进入关键期

今日摩尔线程在科创板上市,发行价114.28元,截至发稿股价涨至620元/股,市值破2800亿。它成立于2020年,核心团队多有英伟达背景,研发投入高,已推出四代GPU架构和产品,专家称国产GPU进入商业化验证阶段。

AI前线
新闻资讯7

OpenAI发长文自曝家丑:搞砸了GPT-4o更新,模型“拍马屁”复盘与总结

OpenAI官网发布长文,详细拆解了一次失败的GPT-4o模型更新。此次更新使模型变得“谄媚”,OpenAI解释了原因,包括奖励信号失衡等。还分析了部署前评审流程失效的因素,并表示从中学到诸多经验教训,将修改评审流程等。

AI寒武纪
开源动态8

港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?

香港科技大学(广州)联合腾讯AI平台部提出VibeWorlding,是可通过多轮对话等自主构建和编辑交互式3D世界的多模态智能体框架。团队开源多项数据,其模型经强化学习后表现超GPT - 5.5等。

机器之心
推荐文章8

Andrej Karpathy最新万字采访:AGI还需10年,RL其实很糟糕,AGI不会导致经济大爆发

Andrej Karpathy在两小时万字采访里阐述AI观点。他认为AGI还需十年,强化学习糟糕,其不会带来经济爆炸式增长。还分享创办Eureka的愿景,想构建“知识斜坡”,让人类在AI时代有更强认知力。

AI寒武纪
产品应用8

预算有限、技术空白:最刁钻的AI用户,是中小企业老板

2026年大模型在中小企业办公环境中应用不佳,工具与场景脱节。华为云推出专为中小企业的Flexus AI智能体平台,它依托自研模型,在多场景准确率领先,已在多行业验证效果,还能辅助内容创作。

InfoQ
算法论文8

首创Mid-training范式破解RL奥秘,Llama终于追平Qwen!

上海创智学院和上海交通大学研究团队深入探讨不同基础语言模型在强化学习训练中的差异,提出中期训练策略,将 Llama 改造成适配 RL 的推理基础模型,缩小与 Qwen 性能差距,还发布了 MegaMath-Web-Pro-Max 数据集。

机器之心
算法论文7

Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制

论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。

深度学习自然语言处理