智能体基准」共找到 4083 篇相关文章

算法论文8

首个GUI多模态大模型智能可信评测框架+基准:MLA-Trust

MLA-Trust 是首个针对 GUI 环境下多模态大模型智能的可信度评测框架,构建了涵盖四核心维度的评估系,对 13 个模型深度评估,揭示可信度风险,还提供评估工具箱,推动其可靠部署。

机器之心
产品应用7

Cursor 3 发布:IDE 不重要了,智能控制台上位,VS Code 这一套开始失效

Cursor 3 发布,用智能管理控制台取代传统代码编辑器,标志 AI 辅助开发工具与开发者工作流程重大转变。它带来多仓库支持、Cloud Handoff 等功能,转型源于竞争压力,业界对智能编排层架构设计未达成共识。

InfoQ
新闻资讯7

GenEnv:智能与环境模拟器之间的难度对齐协同进化 | 直播预约

训练高性能 LLM 智能受限于真实世界交互数据的成本和特性,为此推出 GenEnv 框架,它建立难度对齐协同进化博弈,能让智能表现提升,减少数据使用量,为扩展能力提供数据高效路径。

深度学习自然语言处理
算法论文8

微软推出深度视频探索智能,登顶多个长视频理解基准

尽管LLMs和VLMs在视频分析和长语境处理有进展,但处理数小时长视频有局限。微软提出智能Deep Video Discovery (DVD),以简洁框架在LVBench取得高准确率,将以MCP Server形式开源。

机器之心
开源动态8

首个面向科学任务、真实交互、自动评估的多模态智能评测环境,ScienceBoard来了

ScienceBoard是首个面向科学任务、真实交互、自动评估的多模态智能评测环境。它集成多领域科研软件,构建科研任务集合,评估智能在科学任务上的表现,发现现有模型在科研工作流中远未成熟。

机器之心
新闻资讯7

一场实战派圆桌实录:解码严谨行业智能落地的硬核突围|甲子光年

2025年7月28日,在世界人工智能大会相关论坛的圆桌对话里,来自不同行业的实战派探讨企业级AI智能落地。他们分享落地踩坑经验、应对数据等问题的办法,还预测了未来智能大规模应用的行业。

甲子光年
算法论文8

Agent搜索哪家强?人大高瓴&快手联合发布全新评测基准GISA

人大高瓴与快手联合发布全新评测基准GISA,用于评估智能搜索能力。它解决了现有基准反向构造、评估维度单一、答案易被记忆等问题,含373个高质量查询,实验显示当前搜索智能距人类水平差距大。

PaperAgent
开源动态8

GitHub Trending 榜一的开源 Cowork 来了!4天4.5K星,首个多智能工作流应用!

开源项目Eigent冲上GitHub Trending榜首,4天获4.5K+ Star。它是全球首个多智能工作流桌面应用,完全开源、支持本地模型,有多种智能工作流,具备本地优先、并行工作流等特性,提供三种使用模式。

开源星探
算法论文8

只需1/4预算,性能反超基线:阿里高德提出Tree-GRPO,高效破解智能RL难题

阿里高德提出Tree - GRPO方法解决智能RL难题。它以智能步骤为节点树搜索,在11个数据集中更省预算、表现更好,能在1/4预算超GRPO基线,解决了Rollout成本高和监督稀疏问题。

机器之心
开源动态8

华为推出软工代码智能SWE-Lego,解锁SFT训练极致性能

华为研究团队推出仅基于监督微调(SFT)的软件工程代码智能SWE-Lego,无需复杂RL流程,在SWE-bench Verified基准中表现出色,项目已开源。它有数据、训练和测试时扩展三大创新。

机器之心