「强化学习范式」共找到 2266 篇相关文章
AI仅凭“自信”学会推理,浙大校友复刻DeepSeek长思维链涌现,强化学习无需外部奖励信号
UC Berkeley团队提出新训练方法Intuitor,大模型无需接触真实答案,仅优化自身信心就能学会复杂推理。该方法无需外部奖励信号或标注数据,用模型自身置信程度作内在奖励信号,在多任务表现良好。
浙大&港理工等提出InfiGUI-R1:利用强化学习,让GUI智能体学会规划任务、反思错误
多模态大模型驱动的GUI智能体有潜力,但现有智能体面对复杂任务力不从心。浙大等机构提出InfiGUI-R1及Actor2Reasoner框架,通过两阶段训练提升智能体能力,InfiGUI-R1-3B在多基准测试中性能卓越,为GUI自动化工具开辟新道路。
Palantir 创始工程师深度分享:FDE 模式是 Agent 时代的 PMF 范式
本文编译前 Palantir 高管 Bob McGrew 对 FDE 模式的思考。FDE 团队填补产品与客户需求差距,交付有价值成果。在 AI Agent 时代,因产品需大量探索且要从企业内实践出发,FDE 或成创业公司新范式。
英伟达让机器人「做梦学习」,靠梦境实现真·从0泛化
英伟达推出DreamGen项目,让机器人‘做梦学习’。它利用视频世界模型生成神经轨迹,仅少量现实视频就能让机器人学会新任务,实现从0泛化,还将助力GR00T - Dreams发展。
李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!
全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。
AI大模型重塑学习硬件:从工具到伙伴 | 网易有道孟旭
在 AICon 全球人工智能开发与应用大会·上海站(2025)现场,网易有道孟旭以有道 AI 答疑笔为例,分享智能学习硬件变革逻辑,指出其进化是用户需求、硬件创新与 AI 技术螺旋推进,还探讨大模型应用及未来方向。
OpenAI大神:人工智能导论课程停在15年前,本科首选该是机器学习导论
如今人工智能成科技主流,入门者选对课程很重要。OpenAI研究科学家Noam Brown认为,本科生不应把人工智能导论作首门AI课,因其大纲多年未变,应首选机器学习导论。此观点引发热议。
统一VLA范式!港科大开源StarVLA乐高式架构,复现成本大幅降低
当前具身智能的VLA赛道陷入「碎片化」泥潭,方法难对比、复现成本高。港科大开源StarVLA,提出「乐高式」统一架构,构建模块化开源底座,实现双向模块化,还支持多种训练范式,打通Sim2Real。
CSDN智研社欧洲首聚,共话技术范式转换下的创新与合作
随着大模型代表的第四次技术革命进入关键期,科技范式转换。5月7日,CSDN智研社2025欧洲站首场线下活动在巴黎举办,众多人士交流分享,未来CSDN还将在更多国际城市办活动。
2小时入门「个性化联邦学习」,上交清华开源斩获1700+星 | JMLR'25
上海交通大学和清华大学研究人员开源个性化联邦学习代码库PFLlib,含39种算法、3种场景和24个数据集,支持模拟500设备训练,还有隐私保护评估工具,降低研究门槛。