Agent评估」共找到 3313 篇相关文章

产品应用8

Notion 3.0 |AI转型最成功的互联网产品是怎么做的?

Notion更新3.0,可视为有所有上下文的通用Agent产品,能调用顶尖模型。它有基础AI能力,如选模型、加上下文等,还升级了Agent创建、MCP等功能,依托生态让提示词可变现。

歸藏的AI工具箱
新闻资讯7

Agent Token焦虑:当每次对话都在「烧钱」,技术如何破局?| GAIR Live 029期预告

GAIR Live 029 期线上圆桌将直击 Agent Token 焦虑的底层技术逻辑,邀请技术负责人从架构重构与系统优化双重视角,拆解 Claw 类产品如何从烧钱走向省钱。探讨成本解剖、架构升维、系统优化等核心议题。

AI科技评论
开源动态8

真实科研水平集体不及格!全新基准SFE给主流多模态LLM来了波暴击

上海人工智能实验室AI4S团队推出SFE评测基准,首创三级评估体系,涵盖五大科学领域66项任务。评测显示主流MLLMs在高阶科学任务有挑战,不同模型、学科表现有差异,还构建了SciPrismaX平台推动AI科学评估生态发展。

机器之心
新闻资讯7

DeepSeek新大招曝光:下一步智能体

知情人士爆料,DeepSeek正开发有更强AI Agent能力的新模型,预计年底推出。此前DeepSeek-V3.1已具备更强Agent能力,在工具使用与智能体任务中表现提升。业内对其入局智能体看法不一。

量子位
开源动态8

扣子官宣开源,掀桌大动作背后如何决策?扣子负责人独家披露

7月26日,字节将AI Agent平台「扣子(Coze)」旗下Coze Studio与Coze Loop开源至GitHub,采用Apache 2.0许可证。文章披露开源决策背后故事,探讨开源版目标、定位,以及团队对Agent开发未来的思考。

InfoQ
算法论文8

一文读懂深度表格数据表示学习 | 南京大学

南京大学团队系统介绍表格表示学习领域,将现有方法按泛化能力分三类,比较DNN与树模型优劣,剖析核心挑战,探讨扩展方向及数据集评估策略,旨在建跨数据集稳健评估体系。

量子位
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。

PaperAgent
算法论文8

OpenClaw代码越改越崩?新研究EvoClaw揭示:Agents持续开发成功率仅13.37%

USC邓港大等联合发布评估基准EvoClaw,揭示AI在持续开发场景下表现不佳,成功率仅13.37%。研究还指出当前评测易高估AI能力,提出DeepCommit重构演进历史,分析各模型在持续演进中的局限与问题。

量子位
开源动态8

AI能自己打红警了!经济拉满零交战惨遭打脸,玩家笑疯

Hugging Face推出OpenRA-RL,将《红色警戒》改造成大模型的Agent训练场,50个MCP游戏工具全量暴露,25Hz实时状态流推送,打通三条训练路线,原生接入OpenEnv生态。实战中,Agent经济满分但战斗零分。

新智元
开源动态8

如何实现可验证的Agentic Workflow?MermaidFlow开启安全、稳健的智能体流程新范式

随着大语言模型发展,多智能体系统成新前沿,「Agentic Workflow」受关注。但现有系统存在合理性难保证等问题。新加坡和南洋理工团队推出MermaidFlow,以Mermaid语言显式建模工作流,提升可解释性与可控性,实验性能优秀。

机器之心