智能体评测」共找到 3870 篇相关文章

开源动态8

AI点外卖哪家强,美团LongCat团队做了个全面评测

美团LongCat团队发布贴近生活场景的大模型智能体评测基准VitaBench,以三大高频生活场景为载,构建含66个工具的评测环境。评测显示现有智能与应用需求差距大,该基准已全面开源。

量子位
开源动态7

微软开源多智能自定义自动化工作流系统,加速搭建基于AI的自动化系统

微软开源多智能自定义自动化工作流系统,可助企业用AI智能实现复杂组织任务自动化。该方案整合多项Azure服务构建管道,有聚焦核心价值等功能,还给出部署指南与成本估算。

GitHubStore
开源动态8

拒绝传统 Router“瞎指挥”,多智能如何实现智能任务分配?

企业级多智能系统瓶颈常是负责分发任务的传统 Router 太“傻”,搞不定跨域、解不了冲突、跟不上变化。腾讯云开源 TCAR 智能路由模型,它先推理再选 Agent 集合,经多数据集评测表现出色,还提供完整开源范式。

InfoQ
新闻资讯7

智能工程的演进:从“是否”到“如何” | 2025年AI智能状态调查报告【PPT】

进入2026年,企业对AI Agent关注点从构建尝试转向规模化稳定部署。LangChain公司年底发布《AI Agent现状报告》,基于对超1300位相关人员调研,展示智能工程化图景与趋势,本文拆解报告精华。

AI大模型应用实践
开源动态8

搜索智能也需要「操作系统」:SearchOS 开源多智能协作框架

人大和蚂蚁的 SearchOS 研究,给出搜索智能在长程任务中问题的答案。它借鉴数据库理念,做了多项核心设计,在开放信息检索基准评测领先,已提供多种使用方式,值得长程调研尝试。

机器之心
推荐文章8

2025年多款Deep Research智能框架全面对比

文章从 OpenAI 关于 DeepResearch 的指南入手,对多个开源深度研究智能框架进行架构解构与功能对比,还验了商业化智能应用,为使用者和开发者选工具框架提供参考。

腾讯技术工程
算法论文8

从物竞天择到智能进化,首篇自进化智能综述的ASI之路

普林斯顿大学等机构研究者发布首个自进化智能综述,为领域建统一理论框架和路线图。综述给出形式化定义,围绕What、When、How、Where构建分析设计框架,还探讨评估范式并指明未来方向。

机器之心
推荐文章8

吴恩达来信:智能并行运行以提升效率

吴恩达称并行智能成扩展AI规模新方向。AI性能会随数据量、训练及推理计算量提升,但耗时久。随着LLM每个token价格下降,更多智能工作流被并行化,且相关研究增多。

DeeplearningAI
产品应用8

Qwen3.7:智能新前沿

阿里云正式发布面向智能时代的Qwen3.7-Max模型,将通过API提供服务。它能力全面,编程、办公、长周期执行等表现出色,适配多框架,在多场景评测中领先,能驱动生产力跃升,还经多实战测试验证实力。

千问大模型
算法论文8

工行x上交大发布多智能研究成果,通过群智能刷新翻译新高度!

2025年多智能系统成大模型研发新高地。工行大数据和人工智能实验室与上海交大人工智能学院推出多智能翻译系统TACTIC,以认知翻译学为指导,在相同模型配置下提升翻译效果,在小模型下提升更明显。

深度学习自然语言处理