长期记忆基准」共找到 1564 篇相关文章

算法论文8

ACL 2026|打破推理同质化!阿里达摩院新作让RLVR从重复采样走向有效探索

阿里达摩院智能决策团队提出面向RLVR后训练的探索增强框架I²B-LPO,改进rollout策略,在关键节点生成更具区分度的推理轨迹,结合信息瓶颈自奖励机制,在多个数学基准上提升准确率与语义多样性。

机器之心
产品应用8

嘘,Claude正在「做梦」!睡一觉疯狂进化,一夜暴涨6倍战力

Anthropic在Code with Claude开发者大会上,给Claude托管智能体添加Dreaming功能,让其能自动回顾记忆、自我进化,还发布Outcomes和多智能体编排。法律AI公司Harvey用后任务完成率飙升约6倍。Anthropic还租下22万张GPU算力。

新智元
开源动态8

超越DeepSeek-R1,数学形式化准确率飙升至84% | 字节&南大开源

字节跳动Seed团队与南京大学联合发布CriticLean框架,将数学自然语言到Lean 4代码的形式化准确率从38%提升至84%。该框架创新性地将评估模型置于核心,解决语义对齐等问题,还构建了相关基准测试和数据集。

量子位
推荐文章8

听了Andrej Karpathy最新2小时访谈,我对Agent彻底祛魅了

Andrej Karpathy在播客中表示,Agent发展还需十年,离像实习生工作还差很远,要解决诸多能力问题;他认为强化学习糟糕但其他方法更糟,还提出AI应削减背书式记忆、未来强大AI或仅十亿参数等观点。

MacTalk
推荐文章8

为什么 Agent Memory需要 AML:看 AML “变量控制”的工程设计

传统 Agent 记忆评测有水分,近日放榜的 Agent Memory Leaderboard (AML) 通过严格控制变量构建盲测管线。文章从技术架构深拆其工程细节,还分析了首期榜单,指出其重构评估变量的价值。

AI工程化
新闻资讯8

凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了

4月29日凌晨,OpenAI与亚马逊云科技联合发布多个新动态,如OpenAI旗舰模型进Bedrock预览、Amazon Bedrock Managed Agents预览等。双方合作让Agent有持久化记忆,还推出多项产品,亚马逊云科技成MaaS一极。

InfoQ
算法论文8

谢赛宁盛赞字节Seed新研究!单Transformer搞定任意视图3D重建

字节Seed康炳易团队的最新研究成果Depth Anything 3(DA3),获谢赛宁盛赞。它架构简单,能从多种输入中精准算出物体深度、还原相机位置,在新视觉几何基准上表现出色,核心秘诀是极简设计。

量子位
产品应用8

突发!OpenAI深夜推出浏览器ChatGPT Atlas:一文深度详细解析「率先支持mac OS」

OpenAI推出人工智能驱动的浏览器ChatGPT Atlas,集成对话式AI改变上网方式。它有随行聊天、浏览器记忆、代理模式三大核心功能,面向全球macOS用户上线,更高级功能对付费用户开放,还注重安全与用户控制。

AI寒武纪
开源动态8

三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!

快手开源多模态Keye-VL 1.5,为8B视频理解大模型,公开3大核心创新技术。靠Slow - Fast视频编码等,在20 + 基准屠榜。它能精确视频定位,实验显示通用、视频理解和数学推理表现佳。

CourseAI
开源动态8

荣登HuggingFace周榜首位, 人大高瓴与快手提出ARPO实现智能体高效训练!

人大高瓴与快手提出的ARPO项目受高度关注,荣登Huggingface Paper日榜、周榜双首位。它是为多轮交互型LLM智能体设计的强化学习算法,在基准测试中,用一半工具调用预算就显著优于现有方法。

PaperAgent