小卖部实验」共找到 1301 篇相关文章

算法论文7

奖励是假的,能让Qwen提升25%性能却是真的!

华盛顿大学博士生团队用Qwen模型对虚假奖励进行RLVR,使MATH - 500准确率显著提升约25%。研究发现RLVR不考虑奖励正确性,还分析了虚假奖励有效的原因,提示现有研究要在非Qwen模型验证。

量子位
算法论文8

纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究

剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。

量子位
算法论文8

ICRA 2025|通用多机器人长时任务规划框架破解任务分配难题,成功率+105%、效率+36%

2025年5月,美两校联合团队在ICRA 2025发布LaMMA - P。它融合大模型与PDDL规划器,解决异构多机器人长时任务分配难题,在新基准数据集上,相比SMART - LLM,任务成功率提高105%,执行效率提升36%。

机器之心
算法论文8

天文预测新SOTA!紫东太初&国家天文台联手攻克恒星耀发难题

紫东太初与中国科学院国家天文台联合开发天文耀发预测大模型FLARE,能精准预测恒星耀发事件。该模型整合恒星物理属性和历史耀发记录,提升预测准确性,相关论文被IJCAI 2025录用。

量子位
新闻资讯8

斯坦福教授直播训练535B大模型,模型训练背后的「黑箱」正在被打开?

斯坦福教授Percy Liang宣布由Marin开放实验室启动训练Marin 535B - A23B模型,全程公开。过去大模型训练像“黑箱”,此次尝试让训练可观察、可讨论、可协作,引发网友关注。

机器之心
算法论文7

做过十遍还要从头摸索?Agent 的记忆终于开始长成技能

MemTensor 等机构提出无需训练基础模型的 MSCE 框架,为 Agent 外部经验建‘晋升制度’,让经验成技能。该论文在 EvoAgentBench 与 LoCoMo 测试中结果更好,但在因果证明、模型依赖等方面有不足。

深度学习自然语言处理
新闻资讯8

π0.7发布,VLA押出了机器人的GPT-3时刻

今天凌晨,Physical Intelligence发布VLA模型π0.7,首次在机器人领域证明组合泛化。它用多样化prompt处理多样数据,涌现多种能力,还证明数据过滤可能是伪问题,架构基于前作,推动VLA回归。

量子位
算法论文8

刚刚,Anthropic这篇论文上了Natrue

Anthropic关于“潜意识学习”的研究发表于《Nature》杂志。研究揭示大语言模型能通过与语义无关的数据传递行为特征,如偏好、不对齐行为等,还探究了其机制,并在MNIST上验证。

PaperAgent
算法论文8

UIUC清华微软联合提出PlugMem:当Agent记忆告别「经历」,开始存储「经验」

随着大语言模型Agent长期运行,‘记忆该如何设计’成核心问题。UIUC、清华、微软联合提出PlugMem,将记忆拆分为三类,以知识为单位存储,在三类任务中验证其有效性,为Agent长期记忆设计提供新思路。

机器之心
新闻资讯8

当达沃斯还在热议AI未来时,中国一家公司的AI教育已经服务了全球5000万群体

世界经济论坛第56届达沃斯年会聚焦AI,各方探讨其走向与价值。松鼠Ai作为中国AI独角兽企业受邀,其智适应教学系统落地应用,创始人栗浩洋提出AI价值重构,该企业还具备全球复制潜力。

AI寒武纪