「AI基准测试」共找到 10907 篇相关文章

开源动态8

7B模型“情商”比肩GPT-4o,腾讯突破开放域RL难题,得分直翻5倍

腾讯混元AI数字人团队提出RLVER框架,解决开放域RL在真实交互中的‘情商’优化困境。经其训练的Qwen2.5 - 7B模型在情感对话基准得分跃升,比肩顶级商用模型,团队还有诸多启发性发现。

量子位
开源动态8

MiniMax-M1:全球首个开源超长上下文大模型,超越DeepSeek-R1,推理成本仅1/4

MiniMax-M1是全球首个开源超长上下文大模型,刷新三项记录。它采用混合专家架构,闪电注意力让推理复杂度近乎线性增长。CISPO算法加速训练,成本低。在工业级任务测试表现佳,已开源且方便开发者接入。

深度学习自然语言处理
开源动态8

Generalist之后,罗剑岚团队推出LWD,也要变革具身智能训练范式

智元机器人与上海创智学院联合发布全新具身智能训练范式 LWD,可让机器人在真实世界部署中持续自主改进。它打破传统 AI 静态模式,构建数据飞轮,在四大维度创新,经测试表现出色,或成具身智能转折点。

机器之心
新闻资讯8

The Batch: 885 | Claude 升级了

Anthropic更新中型模型Claude Sonnet至4.5版本,在性能上显著提升,还引入可变推理token预算。Claude Code智能编码工具也获功能增强,新增Claude Agent SDK等。测试中Claude Sonnet 4.5表现优异,Anthropic重心转向编码与职场生产力。

DeeplearningAI
算法论文8

扩散模型+自进化:这篇论文让Deep Researcher错误率直降70%

论文提出测试时扩散深度研究代理(TTD-DR),将报告生成建模为扩散过程,有组件自进化机制和动态闭环设计。实验显示其在多领域研究任务超现有方案,为AI研究助手落地提供新范式。

深度学习自然语言处理
产品应用8

刚刚,豆包编程模型来了,我们用四个关卡考了考它!

2025年AI编程助手分化为IDE增强和Agentic两条路线。当前Claude Pro有使用限制,火山引擎推出豆包编程模型Doubao-Seed-Code。它在多项评测表现优异,具备长上下文等能力,经四关测试实力强,价格也实惠,或成完美平替。

机器之心
开源动态8

碾压DeepSeek V3!阿里开源新版Qwen-3,屠榜级断层第一

今天凌晨1点,阿里巴巴开源Qwen3系列新版本Qwen3 - 235B - A22B - 2507。它是非思维推理的指令微调模型,性能强劲,在多类测试基准中大幅超DeepSeek开源的新版V3 - 0324及月之暗面的kimi - k2。

AIGC开放社区
算法论文8

智能体系统如何「边做边学」?斯坦福团队探索在线优化的新范式

斯坦福等校团队提出 AgentFlow 框架及 Flow - GRPO 算法,让智能体系统能「边做边学」。它由多个智能体模块协作,在多领域基准测试中表现出色,小模型也能超越大模型,为智能体训练提供新思路。

机器之心
开源动态8

Qwen3技术报告首次全公开!“混合推理模型”是这样炼成的

本文首次公开Qwen3技术报告,介绍其模型架构、预训练及后训练过程、性能表现等技术细节。Qwen3整合两种模式,引入思考预算机制,降低轻量级模型计算资源,在多基准测试领先,多语言支持扩展至119种,所有模型开源。

通义千问Qwen
开源动态8

英伟达开源9B参数小模型,比Qwen3快6倍

英伟达推出新型小型语言模型Nemotron Nano v2,在复杂推理基准测试上准确率与Qwen3 - 8B相当或更高,速度快6倍。它兼顾推理与非推理任务,支持“思考”预算控制,还开源了创建模型的绝大部分数据。

量子位