「测试全流程」共找到 3880 篇相关文章
不让“猪队友”拖后腿!哈深新作 AgentDropoutV2,专治多智能体“传话游戏”翻车现场
多智能体系统中,常有agent出错带偏整体。哈工大联合阿里提出AgentDropoutV2,测试时介入,设‘质检员’审核输出,结合失败案例构建‘避坑指南’,在多测试中显著提效,泛化性强。
Anthropic揭秘Agent长线开发架构:引入GAN机制,Claude自主撸出全栈应用
Anthropic公开前端设计和自主软件工程最新突破,为让Claude构建完整应用,从GAN汲取灵感设计多智能体协同架构。介绍架构实践、解决的问题及应用效果,还探讨架构简化和设计规律。
OpenAI深夜放出GPT-5狙击谷歌!基准测试碾压前代模型,价格比Claude更便宜
北京时间8月8日凌晨,OpenAI推出GPT - 5,宣称其更智能、准确,幻觉率低。还推两款新模型,介绍了不同用户套餐。它在编程基准测试表现佳,健康领域能力突出,引发各界热议。
图像编辑模型不止生成:BIGAI&上交大提出EAR范式,系统测试其视觉规划能力
上海交通大学联合北京通用人工智能研究院提出EAR范式,构建AMAZE基准,分析图像编辑模型视觉推理能力。研究发现模型零样本表现弱,扩散式模型更适合视觉规划,CoT效果不稳定等。
11 万 Star 的开源项目,给 AI 编码代理补流程,这套 Superpowers 值得装
110多K Star的开源项目Superpowers,是完整软件开发工作流程,基于17个可组合“技能”。它采用Pull模式,用苏格拉底式追问澄清需求,工作流覆盖多领域,支持多平台,一行命令即可安装。
NeurIPS 2025 | 告别全量扫描!浙大提出COIDO:破解多模态数据选择「高耗」难题
浙大提出 COIDO 框架解决多模态数据选择「高耗」难题。它摒弃全量扫描,用轻量级评分器和小样本采样,将重要性和多样性的优化统一。实验显示,它性能与效率双优且有强泛化性。
红杉中国推出 Agent 基准测试「xbench」,双轨评估体系,关注 AI 真实场景的效用
红杉中国开放AI和Agent基准测试工具「xbench」,采用双轨评估体系,构建多维度测评数据集。首期发布两个核心评估集并排名,提出垂类Agent评测方法论。该工具旨在解决现有评估问题,关注AI真实场景效用。
FUTURUS未来黑科技徐俊峰:侧翼突围,构建AR全栈解决方案|甲子光年
2026崇礼论坛上,FUTURUS未来黑科技徐俊峰指出AI产业面临瓶颈,创业者应‘侧翼突围’。他认为以汽车挡风玻璃为介质的AR技术是数据闭环关键切口,还描绘了AR全栈解决方案赋能车厂的商业蓝图。
Veo 3逼真脱口秀爆火全网,网友:彻底超越恐怖谷!Sora已被完爆
Veo 3生成的脱口秀视频全网爆火,人物、场景真实,声音和嘴型能对上,已超越恐怖谷。它或让人类进入‘模糊时代’,还会颠覆游戏、电影、广告等行业,未来AI生成内容或远超非AI内容。
专业医生远不如AI模型?OpenAI推出医疗开源测试基准HealthBench,o3表现最强
OpenAI推出医疗开源测试基准HealthBench,由262位多国医生合作打造,含5000段真实健康对话。评估显示o3综合表现最佳,顶尖AI处理任务能力超无辅助医生,HealthBench更真实专业有区分度,但也有局限。