智能体基准」共找到 4093 篇相关文章

开源动态8

AgentCPM-Explore开源,4B 参数突破端侧智能模型性能壁垒

清华大学、中国人民大学等联合研发的 AgentCPM-Explore 开源,基于 4B 参数在深度探索任务上表现出色,打破参数壁垒,开源全流程基建,还探索出提升小模型性能的方法。

PaperAgent
新闻资讯8

谷歌云重磅报告:AI智能接管2026年企业核心工作流

谷歌云基于调研发布报告,揭示2026年重新定义角色、工作流和商业价值的五大关键趋势,如智能重塑员工、数字化流水线打通企业、全时在线重塑客户验等,还强调人才技能重塑的重要性。

AIGC开放社区
开源动态8

The Batch: 864 | GLM-4.5:一款开放的智能竞争者

大型语言模型推动智能能力交互竞赛正酣,中国 Z.ai 推出 GLM - 4.5 系列开源权重模型,在推理、编程等基准测试中表现出色,还介绍了其工作原理、研究和测试结果等。

DeeplearningAI
开源动态7

Angular 官方的智能 Skills 助力 AI 编程工具生成现代化的 Angular 代码

谷歌 Angular 团队发布 angular/skills 仓库,含两种智能 Skills,能让 AI 编程智能编写现代化 Angular 代码。这些 Skills 针对特定工具设计,开发者可安装使用,社区对此看法不一。

InfoQ
开源动态8

具身智能大脑+首个SaaS开源框架,智源研究院刷新10项测评基准,加速群智能新范式

智源研究院推出通用具身大脑RoboBrain 2.0与全球首个具身智能SaaS开源框架RoboOS 2.0并全部开源。前者突破主流AI模型瓶颈,后者实现大脑云端优化与小脑技能免适配注册,降低开发门槛。

量子位
产品应用8

挖漏洞何必Mythos,国产智能早跑通了

手握Mythos的Anthropic因安全问题将其锁起,引发安全圈对AI规模化挖漏洞的思考。360集团自主研发的漏洞挖掘智能公开披露两项重大发现,影响超10亿用户,还展示了其技术路线、优势及战略意义。

量子位
产品应用8

OpenAI推出云端编程智能Codex,进一步推动软件工程领域变革

OpenAI昨夜发布研究预览版Codex,一款集成在ChatGPT中的高级编码智能助理。它基于codex - 1模型,支持多种编程语言,有深度代码分析等核心功能,还有codex - mini - latest API版本,或重构软件开发行业。

AI工程化
产品应用8

迎接智能的「觉醒时刻」:EverOS全球公测开启Agent Memory自进化序章

随着主动执行型 Agent 爆发,AI 向自我演化智能跃迁,但现有 Agent 有诸多痛点。EverMind 团队公测专为自我演化智能设计的记忆底座 EverOS,它依托核心算法与进化引擎,提升任务成功率,解决多项技术难题。

机器之心
新闻资讯7

2025CSDI:大模型引领智能研发与IT组织变革

文章指出AI发展将推动私有知识价值增大,其应用成战略重点。如DeepSeek打破行业固有观念,引领变革。未来智能时代经济源于智能,AI重构企业生产力,2025CSDI峰会将探讨相关场景应用。

AIGC开放社区
算法论文8

速度提升,能力却暴跌?扩散模型做智能的残酷真相

南洋理工大学陶大程教授团队联合发布评测报告,揭示扩散语言模型在智能能力上有系统性缺陷,落后自回归模型。还分析其失败原因,提出评测框架,明确能力边界并给出研究建议。

机器之心