实验闭环验证」共找到 2167 篇相关文章

开源动态7

你的「龙虾」真记得你吗?剑桥发布长期个性化记忆基准ATM-Bench

剑桥大学团队开源面向AI个人助理的长期记忆基准测试ATM - Bench,评估AI面对真实生活数据时能否「记住你」。实验结果不佳,专用和通用智能体系统准确率低,凸显长期个性化记忆问答难题。

机器之心
推荐文章7

编程通缩——当代码一天比一天便宜会发生什么

文章探讨编程通缩现象,即AI使软件开发成本等下降。它不同于传统通缩,由生产力提升驱动,会带来延迟与实验、质量两极分化等悖论,还会加速创新,人们应培养相应技能适应。

宝玉AI
算法论文8

模仿学习新范式!Chain-of-Action:轨迹自回归实现动作推理

具身智能领域尚未迎来「GPT时刻」,现有模仿学习范式有缺陷。字节跳动与阿德莱德大学研究者提出「动作链」(CoA)策略,通过轨迹自回归建模解决累计误差,提升泛化性,实验效果显著。

机器之心
算法论文8

ACL 2025 | 让小说角色 「活」起来!复旦BookWorld打造沉浸式小说世界模拟系统

复旦大学团队主导的BookWorld系统,是ACL 2025论文成果。它能从小说提取数据构建AI世界,让角色AI互动创作故事。系统有自主和干预模式,实验表现出色,未来可成互动娱乐平台。

机器之心
算法论文8

中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考

上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。

机器之心
开源动态8

世界模型一口气输出小时级视频不跑偏,开源了

Alaya Lab等联合推出的Alaya - EVOKE能生成小时级视频,解决常见问题。它把记忆搬到模型外,改造教师模型,经多轮技术操作,实验成绩佳,给出清晰训练方案,也指出项目边界。

量子位
算法论文8

ICML 2026|让AI自动发现前沿风险:创智×复旦×牛津发布AutoControl-Arena

当AI智能体走向真实应用,前沿风险藏于复杂长尾场景,难以靠人工覆盖。创智、复旦、牛津联合发布AutoControl Arena框架,自动合成可执行测试环境,还构建X - BENCH验证,已在GitHub开源。

机器之心
产品应用7

刚刚,Claude Code 推出手机通知功能。被催着干活的打工人,从此不能再摸鱼……

Claude Code 新增手机推送通知功能,任务完成会主动 ping 手机,开启方式简单。它还支持桌面通知,与此前功能形成派活、执行、汇报闭环,解决了人如何知晓 AI 完成任务的问题。

AGI Hunt
算法论文8

EvoSkills:自进化的skill,是好skill

文章分享两项Agent Skill最新研究论文,指出智能体技能从手工制作向自动进化转变。介绍EvoSkills和EvoSkill两种自动化Skill进化方案,对比其机制、验证方式等,还提及未来研究方向。

PaperAgent
新闻资讯8

特朗普按下「创世纪」核按钮,AI曼哈顿计划正式启动!

2025年11月24日,特朗普正式签署「创世纪计划」,被比作AI版「曼哈顿计划」。由美国能源部牵头,整合资源打造「美国科学与安全平台」,剑指六大领域,要求9个月内构建AI科研闭环

新智元