智能体基准」共找到 4093 篇相关文章

算法论文7

成功率最高暴跌36.9%!南洋理工首个“模糊指令”测试,直击具身智能落地软肋

南洋理工大学MARS Lab团队联合发布测试基准REI-Bench,量化现有具身智能大模型缺陷。在其测试下,主流任务成功率最高降36.9%。研究还剖析错误原因,给出解法,望引起学界重视。

量子位
开源动态8

刚刚,DeepSeek Harness震撼开源:一切皆插件

今天凌晨,DeepSeek Harness(开发者预览版)开源。它是构建智能的SDK与框架,设计理念为“一切皆插件”,代码量大且模块化,通过配置文件组装不同智能,还具备多方面创新设计和安全策略。

机器之心
新闻资讯7

OpenClaw 带火了给 Agent 的专用邮箱,刚拿了 600 万美金打造 AI 时代数字身份

今年AI浪潮中,智能向“数字员工”演变,OpenClaw加速此趋势。AgentMail获600万美金种子轮融资,为AI智能打造专属邮箱服务,有全功能API交互等功能,还建立安全防范系,用户增长快。

投资实习所
新闻资讯7

GPT-5仅23.3%,全球AI集挂科!地狱级编程考试,夺金神话破灭

最新基准测试SWE-Bench Pro评估AI编程智能,直面真实企业级工程任务。顶尖模型几乎溃败,GPT - 5仅23.3%。该测试解决现有基准数据污染、任务简单问题,能成未来LLM编码能力标尺。

新智元
算法论文8

303页年度最佳AI Code综述:阿里、字节、快手30家顶级机构出品

分享303页《从代码基础模型到智能与应用:代码智能实践指南》,由近30家顶尖机构出品。介绍2021 - 2025年代码大型语言模型发展,分析通用与代码专用LLM能力,阐明研究 - 实践差距,还开展实验。

PaperAgent
开源动态8

开源框架让代码AI偷师GitHub!bug修复率飙升至69.8%,性能创纪录

MemGovern团队联合多高校团队提出MemGovern框架,将杂乱GitHub数据转化为AI可用的结构化记忆。它构建筛选净化流水线,采用先搜后看模式,实验显示能显著提升代码智能的bug修复率,还具跨领域推广价值。

量子位
开源动态7

MotlBot作者被Claude刁难后:MiniMax M2.1是最优秀的开源模型

Moltbot热度不减,开发者挖掘其实用价值,阿里云、腾讯云上线相关云服务。Moltbot作者Peter接受采访,分享项目起源、开发思路等,认为MiniMax M2.1是优秀开源模型,还探讨了智能发展及项目后续规划。

量子位
产品应用8

超脑未来WorldDreamer V4横扫多个权威榜单,世界模型进入群智能时代

超脑未来发布 WorldDreamer V4,它以多智能为基本单位,具多种核心能力。采用新预训练架构,引入 Masked Agent Modeling,用共享隐式世界状态带来新协同范式,还在多权威榜单领先。

机器之心
推荐文章7

Langchain创始人最新分享:如何跨越“原型惊艳”到“生产可靠”的鸿沟

近日,LangChain创始人Harrison Chase在Interrupt大会演讲,指出AI行业‘原型易,生产难’痛点。分享优秀Agent工程师四大素质、智能开发三大关键,还介绍战略预判与产品布局,致力于为智能工程师提供全周期支持。

AI工程化
开源动态8

你敢信?GPT-5的电脑操作水平只比人类低2%了

Agent S3刷新了计算机使用智能(CUA)在「OSWorld」基准测试的记录,性能达69.9%,接近人类水平。它引入bBoN实现并行扩展,还精简框架、引入原生代码智能,已开源并发布论文。

机器之心