长时记忆」共找到 1637 篇相关文章

算法论文8

14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1

如今的大语言模型推理能力关键在于测试扩展,但思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。

机器之心
算法论文8

突破视觉-语言-动作模型的瓶颈:QDepth-VLA让机器人拥有更精准的3D空间感知

视觉 - 语言 - 动作模型(VLA)在机器人操控领域潜力大,但应对序或精细操作任务性能下降,根源是缺乏三维空间感知与推理能力。中国科学院自动化研究所与灵宝 CASBOT 提出 QDepth - VLA 模型,提升了机器人空间推理与操控精度。

机器之心
算法论文8

斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4

斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等大模型。论文解决了RL在代理环境中可变动作优化偏差和稀疏奖励两大挑战,为AI代理发展指明方向。

深度学习自然语言处理
新闻资讯7

先进封装补完计划

2024年美国众议院点名批评美资对盛合晶微投资,后将先进封装列为投资禁区。盛合晶微由中芯国际和电科技合资成立,攻克硅中介层难题。AI芯片变大使台积电产能紧张,盛合晶微为国产芯片提供新选择。

远川科技评论
新闻资讯8

GTC 巅峰对话 Jeff Dean x Bill Dally:预训练范式已死、延迟瓶颈不在计算、谈透 AI 五年未来 | GTC 2026

GTC 2026上,NVIDIA首席科学家Bill Dally和Google Jeff Dean展开重磅对话。讨论了模型能力进步、低延迟推理架构、模型自主进化、数据与算力、训练与推理硬件差别等多方面内容,分享对未来AI的看法与见解。

AI科技大本营
算法论文8

北航,清华,北大联合发布: 异构智能体协同强化学习!

北航、清华、北大联合发布异构智能体协同强化学习论文。提出 HACRL 新范式,实现异构智能体双向互学与独立部署统一;还有 HACPO 算法弥合智能体差异。实验显示性能提升且成本降低,为多智能体协同学习指明方向。

机器之心
开源动态8

微软开源新版Phi-4:推理效率暴涨10倍,笔记本可运行

今天凌晨微软官网开源Phi - 4家族最新版Phi - 4 - mini - flash - reasoning,它参数小性能强,适合边缘设备。采用自研SambaY架构,推理效率涨10倍,延迟降2 - 3倍,多场景测试表现优异。

AIGC开放社区
产品应用7

Gemini 3来了,Software 3.0也快了

作者认为Gemini 3是目前最好的模型,编程前端用Gemini 3,后端用Codex。无编程需求,它也能助力信息处理。Google推出Generative UI,二者结合让我们接近Software 3.0。

newtype AI
开源动态8

攻克大模型训推差异难题,蚂蚁开源新一代推理模型Ring-flash-2.0

9月19日,蚂蚁百灵大模型团队开源新一代推理模型Ring-flash-2.0,独创棒冰算法解决训推差异难题,实现稳定训练。该模型仅激活6.1B参数就能打平40B Dense模型性能,降低推理成本。

机器之心
产品应用7

给Claude Code加个音效提醒

文章指出Claude Code缺少提醒功能,作者用Claude Code自带的hooks功能和macOS系统的afplay工具,实现音效提醒。需要确认播放塞尔达传说BGM,完成播放超级马里奥BGM,还介绍配置方法。

newtype AI