模型测试」共找到 8275 篇相关文章

开源动态8

深夜开源首个万亿模型K2,压力给到OpenAI,Kimi时刻要来了?

昨晚,月之暗面发布并开源 Kimi K2 大模型,同步上线更新 API,价格 16 元/百万 token 输出。它超过多个开源和闭源模型成新 SOTA,展示出领先能力,还介绍训练关键技术,或成模型智能进化关键。

机器之心
新闻资讯7

一个“蠢问题”改写模型规则!Anthropic联创亲曝:瞄准Claude 5开发爆款应用,最强模型的价值会让人忽略成本负担

Anthropic联合创始人Jared Kaplan在YC分享Scaling Law对大模型发展的影响及对Claude等模型的意义。他认为AI发展不平衡,建议构建未完全跑通的产品,还介绍了Claude 4优化,探讨人机协作等内容。

InfoQ
开源动态8

12.1万高难度数学题让模型性能大涨,覆盖FIMO/Putnam等顶级赛事难度,腾讯上海交大出品

腾讯AI Lab与上海交大团队联合推出首个基于自然语言的数学定理证明框架与数据集DeepTheorem。12.1万道高难度数学“特训题”让模型定理证明性能大涨,7B模型性能比肩或超越现有开源和商业模型

量子位
算法论文8

用更一致的轨迹、更少的解码步数「驯服」掩码扩散语言模型,扩散语言模型的推理性能和效率大幅提升

扩散大语言模型发展迅猛,或成下一代大语言模型基础范式有力竞争者。复旦大学等团队发布论文,提出高效解码策略与强化学习训练组合,解决MDLM解码和训练问题,提升推理性能与效率。

机器之心
新闻资讯8

DeepSeek-R2尚未问世,微软小模型捡漏称王?6000样本炼出「数学作弊器」!

微软推出Phi-4推理模型系列,参数最多14B,能在本地高性能笔记本电脑上流畅运行。Phi-4-mini-reasoning在数学推理上性能超越DeepSeek-R1蒸馏模型,且参数规模更小。文章还介绍了模型特点、训练方法、性能表现及局限性等。

新智元
新闻资讯7

Anthropic将在两周内推出新思考模型

据The Information报道,Anthropic将在未来几周推出Claude Sonnet和Claude Opus两款新模型,能在「思考」和「工具使用」间切换,还可自动测试纠正代码。虽此前产品有不足,但新模型处理复杂任务更出色。

AGI Hunt
算法论文8

Qwen3-VL-Seg 深度解读:当多模态大模型学会"像素级精准手术",仅用0.4%参数碾压8B模型

文章深度解读阿里通义实验室发布的Qwen3-VL-Seg,它解决开放世界指代分割问题,用仅17M参数(占基础模型0.4%)在4B规模超越8B模型。介绍其原理、架构、数据、实验结果,还给出实战代码。

机器学习AI算法工程
开源动态8

UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!

多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI开源SWE-Vision框架,让模型用Python代码处理视觉判断。它极简设计,在五个视觉基准测试达最优,提升前沿模型视觉表现。

机器之心
开源动态8

WRC整理床铺机器人背后模型曝光!端到端双系统全身智能VLA,仅凭少量微调就能get任务

星海图在2025WRC展示G0模型,可让机器人自主完成铺床任务。其发布端到端双系统全身智能VLA模型G0,结合真机数据集与架构,还构建开放数据集,评测结果优于π0模型,即将开源。

量子位
开源动态8

罗福莉首个小米成果!开源具身大模型

正式入职小米不到10天,罗福莉作为核心作者的首篇论文出炉。MiMo团队提出并开源全球首个打通自驾与具身操作领域的跨具身基座模型MiMo - Embodied,在29个Benchmark上霸榜。

量子位