「推理能力评测」共找到 4863 篇相关文章
7B模型对标GPT-4o,全球首个医疗代码生成大模型训练平台来了
研究团队发布全球首个医疗代码生成大模型训练平台MedAgentGym,提供评估基准和训练生态,提升大模型医疗代码生成与推理能力。经其训练的Med - Copilot - 7B达GPT - 4o相当水平,解决医疗AI编程瓶颈。
开源Agent模型榜第一名,现在是阿里通义DeepResearch
阿里开源首个深度研究Agent模型通义DeepResearch,在多权威评测集上超越多个Agent模型。它采用多阶段数据策略,有两种推理模式,革新训练流程,已赋能高德出行Agent和通义法睿等应用,且模型等均已开源。
小模型,大能量!200美金的GPT Pro竟然输给了它?
博主用11个场景深度测试昆仑万维的Skywork R1V4 - Lite,它能做到Gemini 2.5 Pro才能干的事,速度快、成本低。在定位、人物识别、生活实用、专业鉴定、学术研究等场景表现出色,核心突破在于主动图像操作与深度推理。
大模型是不是到顶了?瓶颈到底在哪
文章探讨大模型是否到顶,指出‘到顶’争论分三个问题,靠堆大模型提升能力之路变平,受数据和成本约束。但大模型还有后训练和推理时计算两个发展方向,未来进步或来自更会用算力。
挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2
南京大学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨大鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。
Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!
8月17日,阿里发布的Qwen3.8 - 27B成Hugging Face热门第一。它以27B参数在部分测试中与前沿闭源模型比肩,可本地运行。不过推理慢、真实任务表现待提升,它让前沿Agent能力下放到个人电脑。
开源模型首次物理奥赛IPhO夺金!上海AI Lab 235B模型击败GPT-5和Grok-4
上海AI Lab的P1 - 235B - A22B在国际物理奥林匹克竞赛夺金,在HiPhO基准测试获12金1银,超越GPT - 5等闭源模型。团队构建HiPhO基准测试,用多阶段强化学习训练模型,开发PhysicsMinions系统提升推理能力。
大模型开网店,谁是经营高手?E-Commerce Bench开源揭秘
为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。
AI秒懂短视频,快手大模型Keye-VL理解力爆表!技术细节全开源
快手全新多模态大语言模型Kwai Keye-VL上线且开源,能深度融合多模态信息,在视频理解、复杂视觉感知和逻辑推理上表现优异。介绍了其技术架构、预训练和后训练策略及训练架构优化等内容。
阿里安全AGI一次发布3款LLM,8B多维度领先GPT-5.4
近期,阿里安全AGI实验室发布3款Yuvion LLM,在AI安全与内容安全领域多维度领先。它以‘对抗即智能’为原则,构建五类数据体系,采用三阶段训练范式,通过YLRE四级评测体系验证能力。