「评估驱动开发」共找到 2708 篇相关文章
百万规模数据集打造人形机器人通用大模型,实现精细动作跨平台、跨形态动作迁移丨北大人大联合发布
北大和人大团队在通用人形机器人动作生成领域取得重大突破,首创通用动作生成框架Being - M0,构建百万规模动作生成数据集MotionLib,研发文本驱动动作生成模型,实现人体动作向多类型人形机器人迁移,文章将发表于ICML2025。
CUDA 20年护城河一个周末崩了 !Claude独自跑通AMD新GPU
一个周末,Claude直接把自家最前沿模型跑在全新AMD MI355X机架,人类工程师没改一行代码。AMD还给AI开发调GPU的工具,ROCm.AI可让Agent自己部署操作。Agent补生态积累短板,对CUDA生态形成降维打击。
OpenClaw 能“边用边训”了:智能体强化学习训练框架 AReaL v1.0 稳定版发布
3月4日,蚂蚁集团联合清华发布开源强化学习训练框架AReaL v1.0稳定版,主打‘Agent一键接入RL训练’。它解决现有智能体框架接入训练成本高、缺乏持续进化能力的问题,还推出原生训练引擎Archon,集成AI辅助开发体系。
中国AI云的领航者:阿里云栖大会背后的战略重塑与价值重估
本文围绕阿里云栖大会,剖析阿里巴巴战略转型。其向“AI驱动,公共云优先”迈进,市场低估其AI云潜力。大会展示愿景、降价策略与生态布局,从资本、公共云、全栈技术构建优势,虽短期财务承压,长期增长可期。
为什么 Agent Memory需要 AML:看 AML “变量控制”的工程设计
传统 Agent 记忆评测有水分,近日放榜的 Agent Memory Leaderboard (AML) 通过严格控制变量构建盲测管线。文章从技术架构深拆其工程细节,还分析了首期榜单,指出其重构评估变量的价值。
别再设计 Prompt,顶尖工程师已经开始写 Loop 了!
2026年6月,“Loop Engineering(循环工程)”一词热门起来。其核心主张是不用再亲自给AI写提示词,而是设计驱动Agent的循环。Anthropic的工程师还写成了完整手册,介绍搭建方法、关键及最佳实践等。
Fable 5解禁即翻车!写一行代码就降智,开发者破防
消失19天的Fable 5解禁即翻车,因过度审查和双标机制,让开发者破防。但抛开护栏,它执行复杂任务能力强。A社同期发布的Sonnet 5也遭群嘲,此外,A社还提出评估框架并向政府让步。
捅破具身智能天花板!极佳视界新VLA大模型登场,复杂长时程任务近100%成功率
极佳视界推出GigaBrain-0.5M*VLA大模型,以世界模型条件驱动,引入人在回路持续学习机制。在与主流方法对比中,任务成功率提升30%,长时程任务近100%成功,还具备高效准确的价值预测能力。
用Spring AI Alibaba把MultiAgent实现从5天压到5小时
Spring AI和Spring AI Alibaba新版本支持Multi - agent编排。文章展示基于Spring AI Alibaba实现Multi - agent,从原理到实战,给出示例代码,解决手写框架问题,对比两种编排方式优劣,强调选对框架可提升开发效率。
GitHub深夜引爆,最强Claude + Codex合体!全球1.8亿码农一夜解放
微软GitHub宣布重磅更新,正式集成Claude和Codex,与Copilot合体,开发者可通过Agent HQ调用它们完成复杂任务。这标志着GitHub从代码托管平台进化为多智能体协同的「AI战场」,降低了开发摩擦感。