评测榜单」共找到 1216 篇相关文章

开源动态8

Gaia2 与 ARE:赋能社区的智能体评测

文章介绍 Gaia2 与 ARE,Gaia2 是智能体基准 GAIA 升级版,能分析复杂行为,与 ARE 框架一同发布。ARE 可模拟复杂真实条件,支持定制。文中对比多款模型,指出当前模型挑战,并说明评测步骤和 ARE 使用场景。

Hugging Face
开源动态8

开源Agent模型第一名,现在是阿里通义DeepResearch

阿里开源首个深度研究Agent模型通义DeepResearch,在多权威评测集上超越多个Agent模型。它采用多阶段数据策略,有两种推理模式,革新训练流程,已赋能高德出行Agent和通义法睿等应用,且模型等均已开源。

量子位
新闻资讯7

太卷了!专属Coding的新一代Arena来了,有国产模型登上

大模型编程竞争激烈,编码能力提升成军备竞赛。LMArena发布新世代大模型编码评估系统Code Arena,国产模型智谱GLM - 4.6登上首,其编码能力获认可,彰显国产大模型硬核实力。

机器之心
算法论文8

开启 AI 自主进化时代,普林斯顿Alita颠覆传统通用智能体,GAIA引来终章

普林斯顿大学AI Lab推出通用智能体Alita,秉持「极简即是极致复杂」哲学,采用「最小化预定义」与「最大化自我进化」设计范式,可自主创造MCP工具,在GAIA基准测试中表现卓越,还能实现MCP复用。

机器之心
新闻资讯7

【完整名】2024-2025年度中国科技产业投资 | 甲子引力X

当前中国股权投资市场处于关键“渡口”,科技投资曾困境重重,现“止跌回暖”但仍有“堵点”。投资正校准重构,硬科技成主导,AI相关成热点。2025年大会颁布「2024 - 2025年度中国科技产业投资」。

甲子光年
产品应用7

AI 真的能帮你微信下了!

微信支付发布「AI 专属卡」,WorkBuddy 率先接入。用户在 WorkBuddy 能让 AI 找外卖、选套餐、领券、下及支付。介绍了使用步骤,还说明 AI 专属卡支付安全,绑定还有彩蛋。

腾讯技术工程
产品应用7

抢疯了!AI宠物翻译器:800多块,预售2万

PettiChat宠物翻译器售价800多,预售2万。它能将猫狗叫声转成句子,翻译延迟1.2秒,还具备位置追踪、安全警报和声音克隆功能。其靠大模型的声音识别和情绪推理系统实现翻译。

量子位
新闻资讯8

2025 智能体元年,Agent 开发平台深度评测报告解读

2025 年 AI 产业两大核心趋势并行,AI Agent 产业化落地提速。国家工业信息安全发展研究中心赛昇实验室发布评测报告,对阿里云百炼等四大 Agent 开发平台从 RAG、工作流能力、Agent 工具调用三大维度测试,为行业选型提供参考。

特工宇宙
开源动态8

蚂蚁专用模型超越o3!仅用2K训练样本刷新医疗AI纪录

蚂蚁集团联合团队发布《MedResearcher-R1: Expert-Level Medical Deep Researcher》报告,其医学AI智能体MedResearcher-R1用2100条训练样本在医疗基准测试反超通用大模型,靠数据、工具、训练方法三大创新实现突破。

量子位
开源动态7

DeepSeek版Claude Code登顶热:8700星,鲸鱼哥火了

DeepSeek版Claude Code登顶GitHub热,Star量超8700且还在增长。DeepSeek TUI由Hunter Bown用Rust开发,能与DeepSeek深度集成,有多种模式,打破高价API限制,开发者是半路出家的程序员。

机器之心