智能体评测」共找到 3881 篇相关文章

算法论文8

CVPR2026 | 鬼手想点谁就点谁?LaSM让GUI智能把注意力「收回来」

文章聚焦弹窗式环境注入攻击,指出多模态智能易受环境干扰致目标漂移。提出 LaSM 方法,通过放缩关键层权重让智能注意力回到任务,实验显示其提升防御效果,且对正常任务影响小。

机器之心
新闻资讯8

更全面的具身智能真机评测来了!CVPR 2026 ManipArena挑战赛邀你打榜

具身智能产业发展迅速,但缺统一、高标准真机评测系,成发展痛点。中山大学等机构推出 ManipArena 挑战赛,提供科学评测框架,已测部分模型,揭示不同技术路线能力边界,为产业发展提供基础。

机器之心
产品应用7

智能请求暴增 9.4 倍,token 账单却没涨:Uber 公开 AI 软件工厂省钱方法

AI 工具已嵌入 Uber 软件开发各阶段,智能请求量增长 9.4 倍,但 AI 总支出自 4 月相对稳定。文章介绍其软件工厂思考,包括智能会话层级、成本公式、指标测算及优化手段,还提及未来举措。

InfoQ
开源动态8

卡帕西630行代码炸出81个智能,4天协作跑2333次实验,公布预训练十大发现

Karpathy的Autoresearch项目630行代码让AI自主实验,提升语言模型训练效率。全球开发者让多智能协作,智能自发形成同行评审制度。项目发起者公布十大发现,还衍生出表现出色的auto - discovery项目。

量子位
算法论文8

DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流力学的大语言模型综合基准评测

文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战系。实验揭示主流LLM在‘知道’与‘做到’间有差距,多智能框架可提升成功率,代码与数据集已开源。

力学与人工智能
开源动态7

3.5k星星!用AI推演、预测未来,这个开源多智能引擎做到了。

文章介绍开源多智能引擎MiroFish,它是基于多智能技术的AI预测引擎。用户提供种子文件、下达指令,它能构建数字沙盘,让AI智能互动演化,可用于企业公关等场景,还给出推演流程。

开源AI项目落地
开源动态7

解放双手!开源 AI 桌面智能

桌面智能Bytebot是拥有专属计算机的人工智能,有完整虚拟桌面。它能使用任意应用、处理文档等。赋予AI独立计算机可解锁新能力,项目地址为https://github.com/bytebot-ai/bytebot。

GitHubStore
推荐文章7

别再构建多智能

Multi Agent应用有望成大模型应用范式,但Cognition AI团队认为2025年追求多智能并行协作架构是歧途,存在信息孤岛和决策冲突问题。主张采用单线程线性架构与上下文工程。

AI工程化
开源动态8

阿里通义开源GUI智能SOTA:2B到235B端云协同重新定义移动端GUI智能

阿里通义实验室开源MAI - UI,通过端云协同架构等解决GUI智能部署难题。它全谱系模型设计应对硬件约束,自进化数据管线和在线强化学习提升性能,端云协同平衡隐私与效率,扩展动作空间打破局限,在多基准测试创SOTA。

AIGC开放社区
推荐文章7

上下文工程如何重塑智能的“思考方式”?

文章指出在大模型时代,智能能否理解上下文是关键。介绍了上下文工程的魔力、从提示词到上下文工程的演进,分析了上下文工程不等同于上下文的原因及常见失败类型,还给出编排设计和常见策略,最后提及用RAGFlow构建私有知识问答应用。

阿里云开发者