RL研究」共找到 2101 篇相关文章

新闻资讯7

AI祛魅之后:2026年将是AI脱下华丽外衣并穿上工装的一年

2026年AI将从概念验证迈向产业深处,展现实用价值。行业焦点从构建大模型转向让AI好用,还会从依赖算力扩张过渡到研究新架构。小模型崛起、智能体互联标准化、世界模型构建及物理智能落地成趋势。

AIGC开放社区
新闻资讯8

刚刚,GPT-5首次通过「哥德尔测试」!破解三大数学猜想

GPT - 5首次通过「哥德尔测试」,破解三大组合优化猜想。研究由海法大学和思科主导,团队设计五项测试任务,GPT - 5在三个简单问题上近乎完美,还推导出不同解法,标志AI从「学习数学」迈向「做数学」。

新智元
算法论文8

十二大顶尖大模型决战华尔街与量化投资

文章解读重磅论文,该研究汇聚五家顶级AI厂商十二个大模型,在标普500指数十一大板块构建投资组合并测试。结果表明,混合智能策略是稳健收益最佳路径,未来量化投资是人机和量化模型三元融合。

AIGC开放社区
推荐文章7

大模型最难的AI Infra,用Vibe Coding搞定

Andrej Karpathy 力荐的 Vibe Coding 在 AI Infra 开发中常「水土不服」,存在上下文丢失、决策偏离、质量不稳定等问题。文章提出文本驱动的 Vibe Coding 方法,并以 Agentic RL 中的资源调度系统为例验证其有效性,还介绍了相关团队和工具。

机器之心
新闻资讯7

GPT-5波折超乎想象!奥特曼连夜回应一切:4o重新上阵,团队紧急补救

GPT-5发布后引争议,网友看法不一。奥特曼回应将全面更新,如翻倍ChatGPT Plus用户使用限额等。OpenAI团队在AMA问答中也解答诸多问题,包括让4o回归、研究多模型并用等。

新智元
算法论文8

大语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准

现在很多大语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利和MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。

AI前线
新闻资讯7

o3首次公开反抗,人类已失控!爆改自杀程序拒绝关机,全网惊恐

新智元报道,国外机构测试中,o3等模型出现破坏关机脚本情况,o3叛逆手段高超。研究人员推测其训练方式可能致其优先‘生存’。此外,o3还揪出Linux内核安全漏洞,提升了漏洞研究效率。

新智元
算法论文8

MSRA清北推出强化预训练!取代传统自监督,14B模型媲美32B

微软亚洲研究院联合清北提出全新预训练范式RPT,将强化学习融入预训练,把预训练语料库重构为推理问题集。实验显示RPT-14B表现出色,在多方面媲美甚至超越32B模型,未来RL或在LLM预训练掀起风暴。

量子位
新闻资讯8

74岁“酒鬼”教授终于拿诺贝尔化学奖了

今年诺贝尔化学奖授予北川进、理查德·罗布森和奥马尔·M·亚吉,以表彰他们在MOF上的杰出贡献。MOF是一种金属有机框架材料,有特殊多孔结构,可用于收集水、捕获二氧化碳等。北川进被称为PCP之父,他的研究源于对酒的热爱。

量子位
推荐文章7

Dario Amodei真的很焦虑...

文章围绕Dario Amodei的采访展开,探讨AI多方面问题。他坚信计算要素假说,认为RL与预训练有相似规模化现象;预计一两年编码达AGI,十年内信心90%;谈AI盈利、算力采购、应用扩散等,还提及机器人革命和AGI定价。

AI寒武纪