多视角评估」共找到 4731 篇相关文章

新闻资讯7

为AI智能体选型、验收、优化提供量化依据:首部评估标准公开征集中

AI智能体成2025年十大战略技术趋势之首,到2028年至少15%日常工作决策将由其自主做出。但企业面临信任鸿沟,缺乏评估规范。首部聚焦AI智能体应用的团体标准公开征集起草单位与起草人,适用于方,有核心内容与价值。

PaperAgent
算法论文8

LLM越狱攻击的威胁被系统性高估? 基于分解式评分的「越狱评估新范式」出炉

目前LLM越狱攻击评估常依赖间接指标或LLM宏观判断,易有偏差。德国、中国等研究团队提出JADES框架,用分解式评分机制,揭示过去高估越狱攻击威胁,为评估建新标准。

机器之心
产品应用7

构建能源领域的AI专家:一个智能体框架的实践与思考

本文介绍阿里团队在能源领域构建智能体框架的实践。因单智能体处理复杂任务有“注意力发散”问题,团队研发综合能源智能体平台,阐述框架搭建、各组件功能及设计考量,还分享思考与可优化点。

阿里云开发者
开源动态7

智能体安全如何保障?首个企业级AI Agent应用评估标准欢迎共同起草

近期OpenClaw走红,AI智能体从“能理解、能生成”走向“能执行、能协作”,但企业面临智能体上线条件判断难题。智合标准中心组织起草《企业级AI智能体应用效能评估规范》,现公开征集起草单位与起草人。

PaperAgent
开源动态8

告别评估乱象!首个视觉解释综合性基准发布,附人类真值 | KDD'25

埃默里大学团队推出首个视觉解释基准Saliency - Bench,构建8个任务的数据集,提供标准化评估流程与开源工具包,解决评估缺乏标准等问题,推动可解释AI向可靠、透明发展。

新智元
产品应用8

牛,AI 写代码进入“编排时代”:Vibe Kanban 让个 Agent 并行干活~~~

用Claude Code等写代码常需排队,Vibe Kanban思路直接,把AI coding agent当“同事”,用看板分配任务、并行跑agent、可视化review改动。它亮点,有种使用场景,5分钟可上手。

小华同学ai
开源动态7

AI驱动的实时全球情报情报系统,绝大信息免费!覆盖全球实时情报的个维度!

实时全球情报仪表盘是AI驱动的态势感知界面,集成新闻聚合、地缘政治监测与基础设施追踪。数据源为免费公开API,低延迟更新。有种功能,技术栈丰富,聚合领域65+外部数据源。

GitHubStore
7

这个开源工具让AI理解你正在操作的任何界面,俩学生辍学开发的产品,功能超

Everywhere是两个学生辍学开发的开源交互式AI助手,能感知屏幕内容,在任意界面使用。它功能、细节优,支持场景,集成种AI模型,使用简单,还提供个性化体验。

开源AI项目落地
算法论文8

大模型如何泛化出智能体推理能力?清华提出策略游戏自博弈方案MARSHAL

近日,清华大学等机构研究团队提出 MARSHAL 框架,利用强化学习让大模型在策略游戏自博弈。实验表明,轮、智能体训练提升了模型博弈决策水平,将推理能力泛化到通用智能体系统,在一般推理任务表现显著提升。

机器之心
开源动态8

“甲方快乐模型”诞生,拿下平面设计新SOTA!条件一键生成,还能独立调整元素 | 复旦&字节

复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在维度评估基准上表现出色,还支持轮编辑。

量子位