测试任务」共找到 3326 篇相关文章

产品应用7

我用Cursor测了下GPT-5.2,好像并不是那么回事儿~

GPT-5.2发布,奥特曼称其很强。作者用Cursor在真实Coding场景对GPT-5.2和Gemini 3 pro做测试,涉及烟花盛宴、5000篇Paper分析、RAG代码重构,结果显示GPT-5.2在多方面表现欠佳,写代码需慎重。

PaperAgent
产品应用7

Claude Code 实战横评:GLM4.5 vs DeepSeek 3.1(附Windows MCP配置,免费模型接入)

文章对Claude Code里GLM4.5和DeepSeek 3.1进行实战横评,涵盖数据库、网站、游戏等测试案例。还介绍Claude Code在Windows下配置MCP经验,以及接入GLM、Deepseek等模型的方法和免费平台。

AI进修生
开源动态8

Memento-Skills VS OpenClaw 不改模型也能进化

Memento - Skills让AI Agent自己设计自己,通过部署时学习进化,不动模型参数,将经验写进技能库。经测试,在HLE和GAIA基准测试中准确率大幅提升,与OpenClaw等定位不同,有多种部署方式,不绑定模型。

CourseAI
算法论文8

扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反

北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。

机器之心
新闻资讯8

国产AI高考708分,这款模型靠什么成为「屏蔽生」?

高考放榜,媒体对国内外大模型进行测试。综合成绩上,讯飞星火X2物理、历史类表现优异;单科专项中,它在数学、作文等测试也领先。其优势源于数据积累、理解评判标准,还采取软硬件一体化落地路径。

机器之心
新闻资讯7

The Batch: 944 | Llama 之后的时代

Meta发布首个AI模型Muse Spark,是多模态推理模型,在部分健康和多模态测试领先,编程与智能体任务有不足。Meta披露技术细节少,该模型基准测试有竞争力,但其从开放转向封闭引开发者担忧。

DeeplearningAI
产品应用7

OpenCode AI编程实践:利用推理路由低成本开发游戏

文章介绍用 OpenCode 结合 DigitalOcean 推理路由器开发点球大战游戏 PK Shootout。其按任务选模型,多数任务路由到 MiMo V2.5 和 GLM - 5.2,成本约 8.25 美元,远低于只用前沿模型。文中还分析开发各环节及适用场景。

AI工程化
开源动态7

国内首套:港中文团队发布7模态人体动作数据集,揭开大模型理解能力短板

港中文邢国良教授团队博士生蒋思阳完成 CUHK-X 多模态人体动作数据集,成果被 ACM MobiSys 2026 接收。用其测试主流大模型,发现理解人类动作平均正确率仅四成。该数据集数据收集方法反常规,还开展了基准测试

DeepTech深科技
开源动态8

Ψ₀刚刚开源了!迈向通用人形机器人的基座模型

南加州大学团队开源迈向通用人形机器人的基座模型Ψ₀,仅需80条真机遥操作数据,在总体任务成功率和子任务指标上平均领先NVIDIA最新开源模型GR00T N1.6超40%,还介绍了其数据、训练、架构等方面。

机器之心
推荐文章7

本地LLM万字救场指南来了!全网超全AI实测:4卡狂飙70B大模型

文章围绕本地大语言模型(LLM)展开,针对实用性和经济性问题,用Dell Precision 7960塔式工作站对主流模型测试。涉及不同尺寸模型、推理框架等,给出不同配置下性能指标及使用建议,还模拟真实场景测试

新智元