自动评测体系」共找到 1691 篇相关文章

开源动态8

Gaia2 与 ARE:赋能社区的智能体评测

文章介绍 Gaia2 与 ARE,Gaia2 是智能体基准 GAIA 升级版,能分析复杂行为,与 ARE 框架一同发布。ARE 可模拟复杂真实条件,支持定制。文中对比多款模型,指出当前模型挑战,并说明评测步骤和 ARE 使用场景。

Hugging Face
推荐文章7

一文看懂英伟达的产品体系和命名规则

文章由小枣君撰写,详细梳理英伟达产品体系和命名规则,涵盖算力芯片、超级芯片、超级计算机平台等,介绍各层级产品特性,还提及通信技术、开发框架CUDA,助读者清晰了解英伟达产品。

芯师爷
新闻资讯7

旧金山大停电,Waymo自动驾驶汽车瘫痪,特斯拉赢麻了

上周六旧金山大规模停电,由PG&E变电站火灾引发,约12万用户受影响。Waymo自动驾驶汽车因信号灯熄灭大规模瘫痪,造成交通堵塞。而特斯拉开启FSD的汽车正常行驶,凸显不同技术路线优劣。

机器之心
产品应用7

我写了个 Skill,让 Agent 自动给文章配图

作者写了个 Agent Skill 实现自动给文章配图,介绍了 Agent Skills 概念、与传统提示词和 MCP 的区别,阐述配图 Skill 设计思路、SKILL.md 写法、提示词模板设计、工作流程等,还分享了设计选择和使用方法。

宝玉AI
新闻资讯8

2025 智能体元年,Agent 开发平台深度评测报告解读

2025 年 AI 产业两大核心趋势并行,AI Agent 产业化落地提速。国家工业信息安全发展研究中心赛昇实验室发布评测报告,对阿里云百炼等四大 Agent 开发平台从 RAG、工作流能力、Agent 工具调用三大维度测试,为行业选型提供参考。

特工宇宙
新闻资讯8

马斯克想要「杀死」氛围编程,就像FSD搞定自动驾驶

马斯克在X平台称xAI将消除氛围编程,让它回归纯粹编程,能按描述制作应用。氛围编程借助AI根据自然语言指令自动生成代码,若xAI愿景成真,软件开发范式或转变,程序员工作模式也将改变。

新智元
产品应用8

Cursor 1.0 正式发布:AI 代码编辑器进入“自动审查 + 记忆”时代!

智能代码编辑器 Cursor 正式发布 1.0 版本,带来多项重磅功能,如自动代码审查助手 BugBot、Jupyter Notebook 原生支持、项目级 AI 记忆等,还提升了用户体验,是向“AI 编程操作系统”迈进的重要一步。

AI科技大本营
新闻资讯8

让AI自己设计芯片!中国科学院发布「启蒙」,芯片全流程自动设计

近日,中科院计算所联合软件所推出「启蒙」系统,基于AI实现处理器芯片软硬件全流程自动设计,达到或部分超越人类专家水平。该系统在多方面表现出色,如设计的CPU达ARM Cortex A53性能等。

新智元
开源动态8

清华发布世界模型评测新标尺:直击机器人感知与行动鸿沟

清华大学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示模型在感知与行动上的差距,转型为实用型模型是行业挑战。

AIGC开放社区
开源动态8

湾大北交大开源 CutClaw,自动踩点音乐的 AI 智能视频剪辑师!

大湾区大学GVC实验室和北京交通大学团队开源CutClaw,它是模拟专业后期流程的多智能体系统,能实现音乐驱动剪辑,按文字指令自动剪辑,适配多平台,还可解构素材。操作简单,支持多模型。

开源星探