推理学习」共找到 3119 篇相关文章

算法论文8

英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了

英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。

新智元
开源动态8

英伟达&MIT等推出Long-RL,长视频训练速度翻倍

英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。

机器之心
新闻资讯7

Nature重磅发文:深度学习x符号学习,是AGI唯一路径!

大模型虽惊艳,但权威认为仅靠神经网络难达人类级智能。符号AI曾被边缘化,如今‘神经–符号融合’升温。神经网络与符号算法各有利弊,业界探索出不同融合路径,不过对其能否通往AGI仍存争议。

新智元
算法论文8

0人工参与实现梯度更新!MIT新框架让AI自动生成微调数据,权重自主升级

MIT提出新强化学习框架SEAL,可让模型生成微调数据和自我更新指令,实现权重更新。无需人工,模型能自动梯度更新。经知识注入和小样本学习实验验证效果,还介绍了其双循环工作机制。

量子位
算法论文8

ICML 2026 | 只用少量Thinking Tokens,大模型依然能深度思考

近年来,CoT 推理成为提升大模型复杂问题求解能力的重要路径,但带来效率问题。浙江大学等团队提出 Heima 框架,将冗长 CoT 压缩为少量 thinking tokens,在减少 token 数的同时保留推理能力,已被 ICML 2026 接收。

机器之心
8

重磅发现!大模型的「aha moment」不是装腔作势,内部信息量暴增数倍!

中国人民大学等联合团队研究发现,大模型推理有“信息脉冲”,特定步骤互信息值飙升形成“互信息峰值”,对应“思考词汇”。基于此提出无需额外训练提升推理性能的方法,代码已开源。

机器之心
产品应用8

DeepSeek-R1全升级V2版:Token成本低至原来30%

DeepSeek - R1 V2版全维度升级,训练框架从‘单一RL’到‘多阶段协同优化’,推理能力从‘能推理’到‘会优化推理’,还提升了安全可控性,适配生态,推出轻量级模型。

CourseAI
7

三位哈佛辍学生,如何将专用芯片变成估值百亿美元的 AI 算力公司

文章聚焦 Etched 公司,分析推理成 AI 算力主战场背景,介绍三位哈佛辍学生创始人故事,阐述其从芯片到推理集群的产品打造,还提及团队、文化、资本情况,最后分析竞争格局与前景。

投资实习所
算法论文8

为什么这篇谷歌论文被称为「Attention is all you need」V2

谷歌新论文《嵌套学习:深度学习架构的幻象》引发关注,被称为「Attention is all you need」V2。它指出主流优化器是关联记忆系统,提出嵌套学习范式,构建HOPE架构,为AI设计带来新思考框架。

量子位
新闻资讯8

「AI重大飞跃」OpenAI官宣:内部实验模型在IMO 2025中取得金牌,GPT-5即将发布

OpenAI研究员Alexander Wei宣布团队开发的内部推理模型在IMO 2025中获相当于人类金牌成绩,还透露GPT - 5即将发布。模型按人类规则评估,解决5个问题,代表AI通用推理能力飞跃,成果不局限于数学推理

AI寒武纪