智能体评估」共找到 3982 篇相关文章

新闻资讯8

OpenAI首个GPT-5找Bug智能:全自动读代码找漏洞写修复

OpenAI发布由GPT - 5驱动的白帽Agent——Aardvark,能在大规模代码库自动发现并修复安全漏洞。它不依赖传统技术,工作流程清晰,已开启内测。10月多家科技巨头也布局Agentic AI + 代码安全。

量子位
开源动态8

刷新复杂Agent推理记录!阿里通义开源网络智能超越DeepSeek R1,Grok-3

互联网信息检索中,复杂问题让普通开源模型力不从心。阿里通义实验室提出WebSailor方案,通过SailorFog - QA数据集和DUPO算法等创新,提升模型能力,在多基准测试中超越诸多开闭源模型。

量子位
算法论文8

ICML 2025 | 多智能的ChatGPT时刻?上交MAS-GPT实现工作流一键生成

上海交通大学等机构推出 MAS - GPT,提出生成式 MAS 设计范式,可一键生成可执行的 MAS。它解决了现有 MAS 方法无适应性、成本高、泛化性低等问题,实验显示其表现出色,未来潜力大。

机器之心
开源动态7

AutoDev Remote 编程智能:你何必只让 AI 在白天分析需求、设计方案

AutoDev Remote Agent 作为 AutoDev Workbench 一部分进入试运行,可运行在服务器,辅助项目分析规划、编写代码等。它是开源方案,代码可自由发布修改,还介绍了选择它而非 IDE 的原因及未来计划。

phodal
产品应用7

Chaterm Agent Skills + 千问大模型,智能运维再进化

文章介绍Chaterm Agent Skills与千问大模型结合用于智能运维。它能将运维经验打包成技能,提供三种模式,缩短运维时间。文中还阐述了技能概念、工作原理、技术实现及实战案例,鼓励用户尝试创建技能。

阿里云开发者
新闻资讯7

烧钱一年,李飞飞的「空间智能」愿景有变化吗?

在a16z主持的访谈中,李飞飞和Martin Casado探讨「世界模型」等话题,重新介绍World Labs愿景。李飞飞指出语言模型描述3D世界有局限,空间智能是关键,公司已推出相关技术和开源渲染器。

机器之心
新闻资讯8

智能“落地”的芯片,今年都去了MWC

2026年世界移动通信大会(MWC)以‘The IQ Era(智能时代)’为主题,全球2400多家企业参展,其中350家来自中国。中国企业展现了从芯片到终端的系化竞争力,在网络、终端、基础设施、模组等方面均有进展。

芯师爷
新闻资讯8

津渡生科邓司伟:「AI+生物制造」到底是什么?全链智能已经实现

当前生物制造迈向大规模工业化,AI深度介入。津渡生科邓司伟在大会指出,应构建全链路智能闭环,将AI渗透到发现、验证、生产三阶段,重塑工艺边界,实现专业经验去中心化。

AI科技评论
新闻资讯7

ChatGPT 评估员工绩效,评得是真能力吗?

绩效考核季,不少管理者用 ChatGPT 生成绩效评语,认为高效。但文章指出,把关键管理工作交 AI 是‘职业肌肉’萎缩,还给出管理场景下 AI 使用清单,网友也对 AI 辅助绩效评估展开热议。

AI科技大本营
推荐文章7

Kotlin Multiplatform 评估:跨平台开发中的优势与权衡

文章评估了 Kotlin Multiplatform(KMP)在跨平台开发中的优劣势。KMP 可共享代码,编译成原生代码获出色性能,保留原生 UI 选项。虽生态小、有学习曲线等问题,但 Netflix 等大公司已用,未来潜力大。

InfoQ