评测系统」共找到 2228 篇相关文章

算法论文8

不止修bug:Agentic Coding评测走向复杂feature交付新阶段

中国科学院自动化研究所联合华为提出 FeatureBench,构建端到端基础设施并开源。它从单元测试出发构造评测任务,引入多种机制保障任务可执行、可验证,能有效区分模型能力,还提供易用的评测流程。

机器之心
新闻资讯8

从「自我进化」到「DAA」,百度给出 Agent 时代系统答案

2026 年 AI 行业发展微妙,模型能力增强但转化为生产力的企业不多。Create 2026 上百度给出两层答案,构建系统能力,提出 DAA 度量 AI。这是过去三年判断的收束,将非共识整合成面向 Agent 时代的方法论。

AI前线
新闻资讯7

揭秘台积电未来战略核心——晶圆级系统集成

上周台积电研讨会公布2026 - 2028年技术路线图,其晶圆级系统集成技术SoW有新进展。半导体正从单一制程向系统级整合转型,台积电以制程与封装双轨驱动定义规则,还面临高成本等挑战。

芯师爷
新闻资讯7

吴恩达对谈LangChain创始人:企业构建Agen系统的核心认知!

吴恩达与LangChain联合创始人Harrison Chase深度对话,点明构建Agent系统关键要点,如关注系统‘Agentic’、解决构建核心挑战、模块化构建等,还提及被低估领域、MCP问题及AI创业制胜之道。

探索AGI
推荐文章8

突破泛化瓶颈:阿里云智能运维 Agent 评测体系实践

大模型 Agent 在智能运维场景落地常遇泛化难题。阿里云李也博士介绍利用评测集验证和提升智能运维算法泛化性的实践,阐述评测集重要性、构建方法,还展示其在提升智能运维 Agent 能力上的成效。

InfoQ
产品应用7

规模化人工判断:Dropbox 如何借助大语言模型优化 RAG 系统标注

为提升 Dropbox Dash 生成回复的相关性,工程师采用大语言模型辅助人工标注。该方案解决了纯人工标注的局限,通过人工校准大语言模型标注的方法,为 RAG 系统提供了有价值参考。

InfoQ
推荐文章8

深度拆解 Hermes Agent 的记忆系统:它如何修正 OpenClaw 的误区

文章深度拆解 Hermes Agent 记忆系统,介绍其四层记忆系统,包括提示词记忆、SQLite 历史会话存档、智能体技能管理和用户建模。与 OpenClaw 对比,Hermes 更关注缓存效率,遵循冷热分离、缓存优先等原则。

宝玉AI
开源动态8

全模态RAG突破文本局限,港大构建跨模态一体化系统

香港大学黄超教授团队开源多模态智能处理系统RAG - Anything,突破传统RAG技术单一文本局限,整合多模态文档解析等核心能力,解决现有RAG系统痛点,具备多方面技术亮点,有便捷部署方式和多场景应用模式。

量子位
产品应用7

提效40%?揭秘AI驱动的支付方式“一键接入”系统

文章围绕AI驱动的支付方式“一键接入”系统展开。先指出跨境支付接入流程痛点,介绍借助Qwen Coder + MCP工具链构建提效系统的目标。接着阐述技术架构、流程,以及提升AI采纳率的方法,最后展示效果、规划未来。

阿里云开发者
新闻资讯7

Anthropic:警惕评测排行榜!差别可能只是机器的内存更大,而已

Anthropic发工程博客指出,AI编程评测排行榜上排名前列的模型分差小,而运行环境硬件配置能让分数波动6个百分点。同一模型在不同沙箱策略下分数不同,资源配置影响评测结果,排行榜分数差距或因硬件。

AGI Hunt