效能评估」共找到 748 篇相关文章

新闻资讯7

腾讯打出「AI岗位薪酬不限」的底气来自哪?

毕业季AI专业毕业生择业有疑虑,AI下半场竞争重心转移。腾讯覆盖领域广、业务耦合强、有变现案例,契合AI下半场人才成长环境,其青云计划“薪酬上不封顶”,今年筛选标准升级。

机器之心
算法论文8

SearchAgent-X: 打破效率桎梏,释放下一代「AI搜索智能体」的真正潜能

论文提出SearchAgent-X框架解决AI搜索智能体效率难题。研究剖析效率瓶颈,发现精度和延迟问题,提出优先级感知调度与无停顿检索技术,经评估大幅提升性能且不牺牲答案质量。

PaperAgent
算法论文8

何恺明等降维打击!彻底颠覆AI生图,无需预训练一步到位

何恺明团队推出生成模型MeanFlow,它跳脱传统训练范式,无需预训练等,仅一次函数评估就能完成生成。在ImageNet 256×256上表现优越,缩小了一步与多步模型性能差距。

新智元
开源动态8

哔哩哔哩献给二次元世界的礼物—AniSora,目前最强大的开源动漫视频生成模型

动画视频生成评估挑战大,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型。

带你学AI
产品应用8

基于阿里云 AgentLoop 的 DeepSeek Harness 评测实践

本文分享基于阿里云 AgentLoop 平台的 DeepSeek Harness 评测实践。介绍了 DeepSeek Harness 工程架构,阐述 AgentLoop 平台接入方式及价值,还详述评估器设计思路、展示评测结果,最后总结方法论并展望后续工作。

阿里云开发者
算法论文8

一篇Self-Evolving Coding Agents最新综述

当今编码智能体部署后大多静止,自进化编码智能体应运而生,可让Agent通过交互更新自身。文章介绍了其概念、分类,探讨组件进化机制、时机及评估方法,也提及带来的新挑战。

PaperAgent
算法论文8

从「时域建模」到「频域融合」:中山大学团队为传感器人体活动识别提供新思路 | TPAMI 2026

中山大学团队在IEEE TPAMI发表研究,用“三重频域融合”(TSF)框架突破传感器人体活动识别(HAR)领域核心瓶颈。该框架从三个全新“视角”审视问题,经多数据集评估表现出色。

AI科技评论
新闻资讯8

DeepMind 创始人 Hassabis 语出惊人:百万 token 只是在贴胶带,AGI 在 2030 年

DeepMind创始人Hassabis在访谈中评估AGI进展,认为当前范式是最终架构一部分,但持续学习等问题待解决,预计2030年左右实现AGI,还探讨了Agent、蒸馏等多方面内容,并给创业者建议。

MacTalk
开源动态7

你的「龙虾」真记得你吗?剑桥发布长期个性化记忆基准ATM-Bench

剑桥大学团队开源面向AI个人助理的长期记忆基准测试ATM - Bench,评估AI面对真实生活数据时能否「记住你」。实验结果不佳,专用和通用智能体系统准确率低,凸显长期个性化记忆问答难题。

机器之心
推荐文章7

传统PM假设已死!Anthropic的产品经理是怎么工作的?

文章指出在AI指数级增长时代,传统产品管理假设已不适用。以Anthropic的Claude Code为例,展示模型能力大幅提升,介绍了新的产品管理工作流程、四个根本性转变及新节奏,强调判断力的重要性。

AI工程化