测试时路由框架」共找到 3161 篇相关文章

开源动态7

Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板

Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。

InfoQ
算法论文8

BIGAI & 中科大团队提出 MILR: 测试时隐空间推理,让图像生成学会「边想边改」丨ICLR 2026

BIGAI与中科大等团队提出MILR,通过测试时隐空间推理,在不更新模型参数下优化图文表示,提升复杂图像生成能力。该方法在多基准测试达SOTA,还探讨了测试时扩展与奖励模型,未来有诸多拓展方向。

AI科技评论
产品应用7

Anthropic重磅更新skill-creator:创建skill全面告别“草台班子”时代

Anthropic升级skill - creator,让普通人创建skill更友好且有效。将测试等机制引入创作,能验证skill有效性。还支持多智能体并行测试、A/B测试,优化触发描述,为未来自然语言定义skill过渡。

AI寒武纪
开源动态7

Cloudflare 如何解决了 quiche 中的一个拥塞漏洞

Cloudflare 分享发现 CUBIC 的 Rust 实现问题,该问题影响开源库 quiche。团队构建模拟环境测试,发现 CUBIC 陷入恢复循环,用 Reno 测试排除广泛问题,最终一行代码修复,使测试通过率达 100%。

InfoQ
新闻资讯7

Grok 4刷新ARC-AGI-2纪录:15.9%碾压所有公开模型,我们离AGI还有多远?

xAI的Grok 4在ARC-AGI-2测试中获15.9%,成全球最强公开AI模型。ARC Prize主席还原测试过程,虽成绩亮眼,但网友有质疑,且离人类表现差距大。Grok 4在多基准测试领先,定价便宜。

AGI Hunt
算法论文8

Agent框架各自为战?谷歌&微软:用Agent-KB让经验自由流动

当前不同框架的Agent知识无法互通,谷歌、耶鲁、字节、oppo等团队联合提出Agent KB,这是通用记忆基础设施,能让异构Agent框架共享经验。它有师生双阶段检索机制,实验验证其能带来显著增益。

PaperAgent
算法论文8

具身智能能力狂飙,安全却严重滞后?首个安全可信EAI框架与路线图出炉!

具身人工智能发展迅速,但能力与安全出现“脱钩”。上海人工智能实验室和华东师范大学团队撰写论文,为“安全可信具身智能”建立理论框架与蓝图,提出成熟度模型、分析框架等。

机器之心
推荐文章8

YC总结的vibecoding核心指南「如何充分利用Vibecoding 」

顶尖孵化器 Y Combinator 总结了 vibecoding 核心指南,涵盖规划流程、版本控制、测试框架等多方面内容,为开发者提供了利用 AI 进行开发的实用策略和方法。

AI寒武纪
算法论文7

做过十遍还要从头摸索?Agent 的记忆终于开始长成技能

MemTensor 等机构提出无需训练基础模型的 MSCE 框架,为 Agent 外部经验建‘晋升制度’,让经验成技能。该论文在 EvoAgentBench 与 LoCoMo 测试中结果更好,但在因果证明、模型依赖等方面有不足。

深度学习自然语言处理
开源动态8

上海AI实验室造出首个「通才」机器人大脑:看懂世界+空间推理+精准操控全拿下

上海人工智能实验室联合多家单位提出通用具身智能大脑框架VeBrain,能集成视觉感知、空间推理和机器人控制能力。它统一三类任务语言建模范式,有“机器人适配器”,配套VeBrain - 600k数据集,性能测试表现出色。

量子位