模型评测」共找到 7898 篇相关文章

推荐文章8

相比层出不穷的 Agent 框架,不变的 Agent Protocol 是什么

文章围绕 Agent Protocol 展开,指出框架更迭但生产级 Agent 系统问题不变。以 Agent Protocol 为主线拆分 Agent Runtime,探讨其核心、稳定对象、执行模型等,还对比各框架在多维度的表现并给出设计建议。

阿里云开发者
产品应用8

全球AI双榜第一!力压谷歌Veo与Grok,Vidu Q3「参考生」之王归来

这个月初谷歌免费开放Veo 3.1视频生成能力,让AI视频更普及,但模型距‘能交付’仍有差距。Vidu Q3带着‘全家桶’回归,覆盖多领域,在权威评测榜单成绩优异,视觉、听觉和场景能力升级。

新智元
算法论文8

“AI版LeCun”自己讲解论文,自我进化智能体框架生成精美演讲视频

加州大学研究者提出自我进化的学术演讲智能体框架EvoPresent,它由四个智能体协作,核心美学模型PresAesth模拟人类审美判断。团队构建评测体系,实验显示其在内容与视觉设计上提升显著,让AI兼顾逻辑与美感。

量子位
新闻资讯7

当200位具身从业者被拉进同一个屋子

量子位等联合发起沙龙,近200位具身从业者探讨具身智能从实验室走进物理世界的问题。乐聚工程师指出具身数据瓶颈,蚂蚁灵波郑可成介绍模型,上海交大李永露分享评测基准,圆桌对话探讨数据挑战与破局路径。

量子位
开源动态8

GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!

GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。

量子位
算法论文8

与Gemini Diffusion共振!首个扩散式「发散思维链」来了

西湖大学齐国君教授团队提出扩散式「发散思维链」,这是面向扩散语言模型的新型推理范式。它与传统思维链不同,能非线性生成,已应用于两种模型,增强后的模型在相关任务上超越现有模型

机器之心
新闻资讯8

GPT-5 终于发布:别慌、AGI 还没来,第一手的上手体验在这里

GPT-5 发布,距离 GPT-4 发布已过 2 年。它能力强、定价有竞争力,是首个「统一」AI 模型,幻觉率低、代码能力强。免费用户可默认使用,Plus 和 Pro 订阅用户有不同使用额度。开发者可使用三种模式,代码能力测试案例可参考相关网站。

Founder Park
新闻资讯8

同一天,百度、OpenAI双双发力高智能AI!先来实测一波原生全模态文心5.0

2025年,OpenAI凌晨更新GPT - 5系列,百度在世界大会发布文心5.0。它采用原生全模态统一建模技术,参数达2.4万亿,评测领先。实测表现佳,其技术在多方面突破,为大模型演进提供路径,助百度重回竞争中心。

机器之心
产品应用7

我用 GLM-5.2 读 148 万字资料:一天读懂一个知识

作者用 GLM-5.2 处理 148 万字 Transformer 资料,它生成可打开的 HTML 阅读页,将内容排成理解路线。GLM-5.2 在评测榜单中进入第一梯队,主打 1M 上下文,还分享了使用该模型处理资料的具体做法。

AI产品自由
产品应用8

GPT-5败下阵,这款中国AI拿下全球第一,众多医生已在用它做诊断

国家卫健委推进“人工智能+基层应用”,基层医生需实用AI助手。未来医生AI工作室的MedGPT在临床“安全”与“有效性”评测击败国际知名大模型夺冠,其两款助手获医生认可,被视为AI赋能基层医疗最佳实践。

量子位