评测榜单」共找到 1213 篇相关文章

推荐文章8

一文搞懂 Agents 评测丨Anthropic 最新万字长文

传统模型评测方法难评估 Agent 系统,Anthropic 摸索出有效评测设计方法。文章介绍评测结构、意义、方法,涵盖编程、对话等 Agent 评测,还给出打造评测路线图及与其他方法结合的建议。

特工宇宙
开源动态8

国产MiroMind智能体框架,登顶全球预测未来大模型

国产MiroMind公司在全球首个动态实时预测基准FutureX上夺冠,老板是陈天桥。其开源的MiroFlow v0.2智能体框架优势明显,能升级大模型能力,且成本低、可复现。MiroMind在预测赛道领先。

AIGC开放社区
产品应用7

终于,无需邀请码,这款刷新GAIA的Agent你立刻就能用!

今年AI圈新品爱用邀请码等三件套,作者对此不满。天工超级智能体(Skywork)不玩套路,在GAIA评测达SOTA级别。它优化办公三件套场景,使用方便,虽有不足但瑕不掩瑜。

花叔
开源动态8

蚂蚁·安诊儿医疗大模型:正式开源并登顶权威医疗

近日,蚂蚁集团联合浙江省卫生健康委开源自研的蚂蚁·安诊儿医疗大模型。它基于蚂蚁百灵大模型架构,经深度训练,是参数规模最大的开源医疗模型。该模型在多评测中表现出色,有三阶段训练流程,架构高效、推理快,已开源助力行业发展。

新智元
产品应用8

Artificial Analysis 第二,SkyReels-V4 宣告 AI 视频进入「全栈统一」阶段

昆仑天工的 SkyReels-V4 在 Artificial Analysis 文生视频排第二,ELO 评分 1090。它有「运动参考」能力,能覆盖视频创作全工作流,背后靠统一拼接框架和双流 MMDiT 架构,体现 AI 行业「统一」趋势。

Founder Park
开源动态8

医疗领域DeepSeek时刻:蚂蚁 · 安诊儿医疗大模型正式开源,登顶权威

2026 年初,OpenAI 报告显示不少人用 ChatGPT 咨询医疗问题,还发布了 ChatGPT 健康。近日,蚂蚁集团等开源的蚂蚁・安诊儿医疗大模型或成最优解,它参数量大,在多评测中登顶,技术优势明显。

机器之心
新闻资讯8

刚刚,全球AI百强发布!ChatGPT稳坐第一,DeepSeek第三,前50有22个来自中国

a16z发布「全球Top100消费级GenAI应用」,显示AI竞争格局渐稳,进入多极化阶段。中国多款产品跻身前十,谷歌携四款产品入,ChatGPT居首,Grok紧追,氛围编程崛起,还有14家‘全明星’公司从未缺席。

新智元
开源动态8

中国19岁常青藤少年重塑AI记忆,斩获各大全球第一,点亮AI联想科技树

M-Flow记忆引擎引发海外开发者社区热议,GitHub star破千,在三大公开benchmark评测中夺冠。它由19岁团队心流元素开发,采用Cone Graph分层结构,实现Graph RAG新范式,更注重联想,而非纯搜索。

新智元
推荐文章8

人类研发时代结束?XYZ最强Search Agent横扫七大,300个Agent跑通AI4AI全栈闭环

近日,XYZAI Lab发布两款Deep Search Agent,刷新多项评测SOTA成绩。其背后是新型AI4AI研发范式,让AI驱动研发闭环。XYZ团队用AI解决多方面问题,在Deep Search验证,未来有望拓展更多场景。

机器之心
推荐文章7

揭秘大模型评测:如何用“说明书”式方法实现业务场景下的精准评估

文章系统性介绍业务场景下大模型评测流程,包括需求分析、评测集设计生成、维度设定、任务执行和报告输出。指出评测挑战,如设计维度和集,还给出评测方法及案例,像蚂蚁评测集、业务自动化评测

阿里云开发者