性能测试」共找到 3317 篇相关文章

推荐文章7

刚刚,Thinking Machines Lab博客提出在策略蒸馏,Qwen被cue 38次

Thinking Machines Lab发布《在策略蒸馏》博客,提出在策略蒸馏可结合强化学习纠错与SFT奖励密度,成本低且能让小模型有强大性能。该成果受Qwen团队启发,大量用Qwen3模型。还对比了不同训练方法。

机器之心
算法论文8

智能体系统如何「边做边学」?斯坦福团队探索在线优化的新范式

斯坦福等校团队提出 AgentFlow 框架及 Flow - GRPO 算法,让智能体系统能「边做边学」。它由多个智能体模块协作,在多领域基准测试中表现出色,小模型也能超越大模型,为智能体训练提供新思路。

机器之心
产品应用7

Hexstrike AI的安装及交互跟踪环境

Hexstrike AI是基于专业化Agent协同的智能渗透测试系统,有强大自动化攻击能力。文章介绍其安装方法,包括服务端和客户端配置,还提及搭建跟踪系统及后续计划,将深入分析专业AI代理原理及关注v7.0新功能。

AI与安全
开源动态8

牛!小米开源「音频语言模型」,超1亿小时预训练时间,音频理解和输出能力是真顶!

小米推出开源音频语言模型MiMo - Audio,有超1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解超Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。

开源AI项目落地
推荐文章7

GPU到底是如何工作的?这篇AI Infra入门全部告诉你

本文详细介绍了GPU工作原理及编程模式。它从图形渲染发展到GPGPU,NVIDIA推动其通用计算。还阐述了CPU/GPU异构架构,对比二者性能,介绍编译、加载、启动过程,以及GPU硬件架构、编程与执行模型,分析SIMD和SIMT。

腾讯技术工程
开源动态8

里程碑时刻!首个100B扩散语言模型来了,技术报告揭秘背后细节

蚂蚁集团与高校联合团队推出 LLaDA2.0 系列扩散语言模型,其中 LLaDA2.0 - flash 参数量达 100B。技术报告披露细节,其解决了 dLLM 做大做强难题,性能比肩 AR 模型,为扩散模型工业化带来转机。

机器之心
新闻资讯8

刚刚,GPT-5.2满分屠榜,OpenAI十周年王者归来

OpenAI 十周年推出 GPT - 5.2 系列模型,包括 Instant、Thinking 和 Pro 版本。它在多方面表现出色,刷新多项基准测试 SOTA 水平,如 AIME 2025 获满分,在 GDPval 达人类专家水平。还在编码、视觉理解等能力上有显著提升。

机器之心
产品应用7

GPT-5 在 Lovable/Vibecode 中氛围编码,附 GLM-4.5 对比 (反向搜索引擎、吵架的俄罗斯方块)

文章展示GPT - 5在网页端、Lovable、Vibecode的测试案例,与GLM - 4.5对比。如GPT - 5在WebDev Arena创纪录,不同版本使用限制不同。还列举多个应用案例,指出GPT - 5有不足,GLM4.5全栈开发表现不错。

AI进修生
新闻资讯7

硅谷今夜学中文!Cursor被曝「套壳」国产,AI顶级人才全是华人

新智元报道,硅谷AI圈现神奇现象,不会中文难进核心团队。海外模型频“偷师”国内开源模型,如Cursor的Composer思考时说中文,Windsurf用GLM-4.6微调。国内开源模型量大管饱、性能好还便宜,能力稳居第一梯队。

新智元
产品应用8

全球首个英伟达含量为0的万亿模型,成了海外开发者的抢手货

美团推出LongCat-2.0,是首个在国产算力上实现全链路训推闭环的万亿参数模型。它多项性能强,适配主流编程工具,架构设计原创,还证明了国产算力有支撑大模型迭代的能力,训推成本更低。

量子位