智能体评测」共找到 3872 篇相关文章

开源动态7

315 行代码构建编程助手,Go大佬揭开智能的「神秘面纱」

知名Go大佬Thorsten Ball用315行代码构建编程智能,虽无法与Claude、Gemini等编码功能媲美,但为初学者提供学习范例。文章分享构建步骤,包括准备工作、添加工具等,展示如何让智能与Claude对话及使用工具。

机器之心
开源动态8

腾讯开源智能新框架:不用训练无需充值,用开源模型实现SOTA Agent

智能框架是推动智能生态发展的基础设施,但现有框架存在上手门槛高、依赖闭源模型等问题。腾讯优图实验室开源Youtu - agent框架,无需训练模型、不依赖闭源API,性能领先,有多个核心亮点和典型应用案例。

量子位
产品应用7

Cursor 3 发布:IDE 不重要了,智能控制台上位,VS Code 这一套开始失效

Cursor 3 发布,用智能管理控制台取代传统代码编辑器,标志 AI 辅助开发工具与开发者工作流程重大转变。它带来多仓库支持、Cloud Handoff 等功能,转型源于竞争压力,业界对智能编排层架构设计未达成共识。

InfoQ
算法论文8

ACL'25 | CIGEval:一种基于多模态大模型的可控生图评测智能

阿里国际AI团队提出CIGEval,这是基于多模态大模型驱动的图像生成评估智能框架。它集成多功能工具箱,通过任务拆解与工具调度提升评估准确性与可解释性,已在ComfyUI - Copilot上线。

PaperAgent
产品应用8

将科研脏活累活真·丢给AI!上海AI Lab推出深度科研智能FlowSearch

上海人工智能实验室推出深度科研智能FlowSearch,它由动态结构化知识流驱动,有三大核心模块。在多个科研基准上性能领先,能让科研更高效,标志科研智能迈向新阶段,还为未来系统奠定基础。

量子位
新闻资讯7

一场实战派圆桌实录:解码严谨行业智能落地的硬核突围|甲子光年

2025年7月28日,在世界人工智能大会相关论坛的圆桌对话里,来自不同行业的实战派探讨企业级AI智能落地。他们分享落地踩坑经验、应对数据等问题的办法,还预测了未来智能大规模应用的行业。

甲子光年
开源动态8

社区供稿丨AgentCPM-Explore开源,4B 参数突破端侧智能模型性能壁垒

清华大学、中国人民大学等联合研发的 AgentCPM-Explore 智能模型开源,它基于 4B 参数,在深度探索类任务表现佳。有打破参数壁垒等亮点,还开源配套工具,提供应对小模型挑战方法,邀伙伴共建生态。

Hugging Face
开源动态8

8B 端侧写作智能 AgentCPM-Report 开源,DeepResearch 终于本地化

1月20日,8B端侧写作智能AgentCPM - Report开源。它以端侧模型为核心,实现本地化部署与SOTA性能双重突破,亮点在于极致效能、本地安全保障,在多评测基准表现出色,部署便捷,两大创新支撑其优秀性能。

InfoQ
开源动态8

GitHub Trending 榜一的开源 Cowork 来了!4天4.5K星,首个多智能工作流应用!

开源项目Eigent冲上GitHub Trending榜首,4天获4.5K+ Star。它是全球首个多智能工作流桌面应用,完全开源、支持本地模型,有多种智能工作流,具备本地优先、并行工作流等特性,提供三种使用模式。

开源星探
算法论文8

只需1/4预算,性能反超基线:阿里高德提出Tree-GRPO,高效破解智能RL难题

阿里高德提出Tree - GRPO方法解决智能RL难题。它以智能步骤为节点树搜索,在11个数据集中更省预算、表现更好,能在1/4预算超GRPO基线,解决了Rollout成本高和监督稀疏问题。

机器之心