自演化范式」共找到 2030 篇相关文章

算法论文7

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。

机器之心
算法论文8

南大周志华团队最新力作:一个算法通吃所有,在线学习迎来新范式

世界是动态变化的,AI 模型需具备在线学习能力,领域提出适应性遗憾值指标。现有算法通用性不足,南京大学周志华团队研究具有双重适应性的通用算法,提出元 - 专家框架等,还研究了在线复合优化问题。

机器之心
开源动态8

vivo研蓝河操作系统内核开源!Rust开发新机遇来了

vivo宣布开源研蓝河操作系统内核,它由Rust语言编写,解决了传统C语言难题,更轻量化、对硬件要求低且支持多架构。此次开源不仅是国产操作系统突破创新,还将推动Rust生态发展。

量子位
算法论文8

3D VLA新范式!CVPR冠军方案BridgeVLA,真机性能提升32%

中科院动化所提出BridgeVLA模型,将3D输入投影为2D图像并利用2D热图进行动作预测。它训练分两阶段,在多仿真基准和真机实验表现卓越,仅3条轨迹基础任务成功率达96.8%,真机性能提升32%。

新智元
算法论文8

AI数学能力暴涨100%,进化直逼RL极限!CMU新作颠覆认知

数据枯竭成AI发展瓶颈,CMU团队提出SRT方法,让LLM我进化,提升数学与推理能力,性能逼近传统强化学习。研究还分析其局限,提出缓解奖励作弊策略及应对模型崩溃的方法。

新智元
新闻资讯8

万字实录:VLA 范式,具身智能的曙光与迷雾丨GAIR Live

2025年5月9日,雷峰网等举办“具身智能之VLA的实践与突破”线上圆桌沙龙。多位专家探讨VLA定义、起源、技术路线等,指出其面临推理、数据等瓶颈,还讨论了与强化学习结合、数据选择、提升泛化性、长程任务及落地场景等问题。

AI科技评论
产品应用7

怎么回事?刚被OpenAI收购,Windsurf就发了个己的模型

5月初,刚被OpenAI收购的Windsurf发布AI编程模型SWE - 1,该模型针对软件工程全流程,核心是流动感知,实现人机然交接。它有三个系列,已上线可免费使用,开发灵感源于编辑器,在评估和实测中表现良好。

Founder Park
推荐文章8

Anthropic发布循环设计指南:权威拆解当下最火的AI新范式loop

Claude Code团队明确loop定义,将其分四大类,给出选择循环及控制Token消耗的实用指南,还介绍保持代码质量方法,最后总结各循环适用场景、建议功能,指导用户开始使用。

AI寒武纪
新闻资讯8

银河通用王鹤:具身智能正迎来己的 「AlphaGo」 和 「ChatGPT」时刻

银河通用创始人王鹤在2026年北京智源大会指出,具身智能正迎来“AlphaGo”和“ChatGPT”时刻。银河通用取得多项首创突破,其基座大模型“银河星脑”展示完整技术脉络,引领具身智能迈向通用未来。

AI科技评论
新闻资讯8

己会失业!田渊栋八人天团狂揽44亿元,杀入「递归进化」赛道

Recursive Superintelligence由八位顶尖AI研究员创立,获GV、英伟达等投资6.5亿美元。他们要让AI我训练,实现递归我进化,若成功或使AI研究员岗位消失。此前已有相关成果,产品端Anthropic也在推进AI主动性。

新智元