「AI测试集」共找到 10825 篇相关文章
Agent失忆怎么办,Anthropic教你做好工作交接
文章指出AI Agent跨上下文窗口执行长任务时易失败,Anthropic用Opus 4.5实验发现,问题根源是交接差。解决办法是让Agent像人类工程师一样留文档、进度和测试,拆分流程,严格规范,提升测试覆盖率。
龙虾创始人深夜点赞:百度 DuMate,打工人的 AI 搭子
文章介绍百度新上线的产品 DuMate,它被定位为首个「国产企业级满血版 OpenClaw」。安装简单,能深度集成百度工具生态,部署方便且安全。通过多场景实测,其任务完成度高,是打工人实用的 AI 搭子。
被骂疯了!微软CEO刚甩出年终反思:“今年别说AI垃圾了”,“模型滞后”新定义遭痛批,网友:你是真脱离现实
微软CEO Satya Nadella发布年终反思博文,定位2026年为‘AI关键之年’,提出‘模型滞后’,划定三件关键事,却遭网友痛批。同时微软推进AI融入Windows,引发对其动机和市场前景的质疑。
谷歌AI连发6篇数学论文!Gemini攻入博士级科研,91.9%刷爆SOTA
谷歌DeepMind放出多篇重磅论文,Gemini Deep Think成「科研合伙人」,攻克多领域难题。谷歌打造基于Gemini的「AI数学家」Aletheia,在博士级难题获科研里程碑,首批6篇论文成果斐然。
如何为 GPU 提供充足存储:AI 训练中的存储性能与扩展性
文章分析 MLPerf Storage v2.0 测试结果,探讨不同存储系统在 AI 训练中表现。在满足 GPU 利用率阈值下,能支撑更多 GPU 的存储系统扩展性与稳定性更强,还需关注资源利用率。以太网存储方案灵活且成本效益高。
AI竟会「自己认错」?破解多智能体协作「罗生门」,斩获ICML 2025 Spotlight
多智能体AI系统任务失败后,开发者常难定位问题。PSU、杜克大学与谷歌DeepMind等机构提出「自动化失败归因」,发布Who&When数据集,探索三种归因方法,虽目前效果欠佳,但为打造可靠系统提供方向。
成本降九成,准确率100%!MIT反常识架构挑战硅谷信仰
慕尼黑工业大学等研究者指出企业AI落地问题源于数据乱。RUBICON架构用AQL查询语言,把操作权交用户,让LLM在精确范围工作。测试中它准确率100%,成本低,优于现有智能体AI方案。
你的「龙虾」真记得你吗?剑桥发布长期个性化记忆基准ATM-Bench
剑桥大学团队开源面向AI个人助理的长期记忆基准测试ATM - Bench,评估AI面对真实生活数据时能否「记住你」。实验结果不佳,专用和通用智能体系统准确率低,凸显长期个性化记忆问答难题。
Jack Clark: 美国 AI 政策的隐形推手,时代的良心还是囚徒?
本文深入剖析Jack Clark,他关注中国AI进展,认可其成就,但对中国态度强硬。身为美国AI政策“民间沙皇”,他为美国遏制中国AI发展设计五层战略,文章探讨其进入AI核心圈原因、政策理念及背后悖论。
2个人不到1年做到月入百万,这个AI网文创业故事太疯狂了!
本文讲述猛哥的AI网文创业故事,他和合伙人不到一年实现月入百万。介绍其从0到1的过程,包括选赛道、精简创业、社群运营、构建提示词生态等,还分析了增长和盈利模式及难以复制的原因。