权威评测」共找到 698 篇相关文章

开源动态8

300个AI员工,跑满4000步不崩,Kimi新一代模型K2.6来了

月之暗面开源发布 Kimi K2.6 模型,在通用智能体、代码编写和视觉理解等综合能力上全面跃升。它在多项测试成绩领先,能连续工作13小时,还在全栈开发、多智能体协作等方面有出色表现。

AIGC开放社区
开源动态8

2026 AI 大模型技术体系综合开源影响力榜单发布,中国开源实力领跑全球

2026年全球AI产业迈入新阶段,开源生态影响力成关键。4月17日CSDN联合多家机构发布《2026大模型技术体系综合开源影响力榜单》,从四大维度、53项细分指标评估,呈现开源生态地图,助力中国AI开源跨越。

AI科技大本营
算法论文8

CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了

北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方面能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。

机器之心
新闻资讯8

刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude

阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。

InfoQ
新闻资讯8

王小川:30亿现金在手,明年IPO,toC产品马上就发

百川智能CEO王小川明确发展主线,百川开源新一代医疗大模型Baichuan-M3,在医疗评测中表现优异。公司约30亿资金,预计2027年IPO,今年将发两款to C医疗产品,重点在院外诊疗。

量子位
产品应用7

实测GPT Image 1.5,拼尽全力还是没能打败Banana。

作者实测OpenAI新发布的GPT Image 1.5,将其与Google的Banana Pro对比,从信息准确性、真实质感、精准编辑、世界知识四个维度评测,发现GPT Image 1.5有提升但仍有不足,Google进化速度惊人。

数字生命卡兹克
算法论文8

T2R-Bench发布:业内首个由表格生成报告工业基准

为解决大语言模型将表格信息转化为报告的难题,研究团队提出“表格到报告”任务,构建双语基准T2R - bench,其涵盖多垂域表格,还设计评价指标体系,实验显示大模型在该基准上提升空间大。

CourseAI
开源动态8

告别“炼丹玄学”:上海AI实验室推出首个大模型数据竞技场OpenDataArena

上海人工智能实验室OpenDataLab团队推出开放数据竞技场OpenDataArena,致力于将数据质量评估从“玄学”变为“科学”。它有数据评测榜单和完整可复现的数据价值验证体系,为多类需求提供解决方案,还开源了核心工具。

量子位
开源动态8

北大、字节跳动联手发布SWE-Swiss:一把修复代码Bug的「瑞士军刀」,完整配方直指开源SOTA

北大、字节跳动等联合研究提出SWE - Swiss配方,用于训练解决软件工程问题的AI模型。32B参数的SWE - Swiss - 32B在SWE - bench Verified上准确率达60.2%,各训练环节效果显著,模型和数据将开源。

机器之心
开源动态8

看遍奥斯卡后,VLM达到电影摄影理解新SOTA|上海AI Lab开源

上海人工智能实验室等推出ShotBench、ShotVL及ShotQA,ShotBench含超3.5k问答对,ShotQA约7万个问答对。ShotVL在ShotBench评测中表现出色,3B参数的ShotVL-3B增益达19.0%,超越GPT - 4o等。

量子位