评测环境」共找到 1070 篇相关文章

开源动态8

搜索智能体也需要「操作系统」:SearchOS 开源多智能体协作框架

人大和蚂蚁的 SearchOS 研究,给出搜索智能体在长程任务中问题的答案。它借鉴数据库理念,做了多项核心设计,在开放信息检索基准评测领先,已提供多种使用方式,值得长程调研尝试。

机器之心
开源动态7

OpenAI公开大规模稳定训练的秘密,英伟达AMD英特尔都受益

OpenAI通过OCP开放超大规模AI训练用的网络协议MRC,它能确保大规模训练环境下网络通信稳定。该协议由OpenAI联合英伟达等厂商花两年完成,从拓扑、传输、路由维度保障网络可靠性。

量子位
推荐文章8

一个文件让 AI Coding 效率翻倍:AGENTS.md 实践指南

文章围绕如何写好 AGENTS.md 展开,介绍其是给 AI 看的项目指令,能解决项目对 AI 不友好的痛点。还阐述了编写原则、实践方法、选择原因、模板和实施建议等,可让 AI 高效理解项目,提升开发效率。

阿里云开发者
开源动态8

第二代PPTAgent来了!中科院软件所开源首个本地通用幻灯片智能体,9B参数打平GPT-5

中科院软件所开源第二代PPTAgent -- DeepPresenter,将幻灯片智能体模型与智能体沙箱环境一同开源。它解决了AI制作PPT的痛点,以9B参数打平GPT - 5,在消费级显卡上有出色表现。

机器之心
产品应用7

老黄呼吁所有企业「养虾」当天,阿里正规军入场,「悟空」把路铺平了

2026年初,OpenClaw火了,黄仁勋呼吁企业制定相关战略,但它存在环境依赖复杂等问题,企业不敢用。阿里发布企业级AI原生工作平台「悟空」,解决企业安全、工作流耦合和规模化等问题,被阿里重点布局。

机器之心
开源动态8

给GUI Agent装上「世界模型」:阿里通义用混合数据+统一思维链,让模型学会预判屏幕变化

伴随多模态大模型发展,GUI Agent成人机交互新范式,但构建高可用、跨平台的GUI Agent面临诸多挑战。阿里通义实验室开源Mobile - Agent - v3.5框架及GUI - Owl - 1.5模型家族,解决了相关技术壁垒。

量子位
新闻资讯8

0行人类代码!OpenAI内部绝密实验曝光:3人团队5个月砸出百万行级产品

OpenAI工程团队进行内部实验,构建并发布零人类代码的内部软件产品,代码全由Codex智能体编写。团队分享开发经验,如重新定义工程师角色、让应用对智能体可见等,还面临一些未知挑战。

AI寒武纪
算法论文8

清华刘洋团队论文:揭示为何 70B 的医疗模型,反而不如 8B 会问诊丨ILCR 2026

在医疗AI领域,模型静态评测与临床问诊能力存在断层。清华刘洋团队提出DOCTOR - R1,将临床问诊建模为POMDP,用强化学习训练。实验验证了其有效性,对医疗AI发展有深远启示。

AI科技评论
算法论文8

Skills刚火,就有零Skill的Agent来了…

Skills爆火之际,云玦科技团队提出不用Skills的零Skill Agent。它以Gemini 3 Pro为后端,在多个评测集表现出色。采用原位自进化框架,开源且成本低,或助力开源模型弯道超车。

量子位
算法论文8

今年看到最系统的AI Agents时代Memory综述~

分享由NUS、人大等联合出品的《Memory in the Age of AI Agents: A Survey》。用三维框架讲透200+篇论文,提出新三大记忆形态,展望7大前沿,还涵盖记忆各方面知识及资源。

PaperAgent