编程评测」共找到 1657 篇相关文章

产品应用8

MiniMax M2.5发布:硬刚 Claude Opus,一美元包断一小时的生产力

MiniMax M2.5发布,硬刚Claude Opus 4.6,以一美元包断一小时的低价降低AI生产力门槛。它在编程、办公等多场景表现出色,速度快且成本低,背后是RL Scaling等技术支撑。

AIGC开放社区
算法论文8

三维空间太难懂?RoboTracer让机器人理解复杂空间指令,推理3D空间轨迹,开放世界也能精确行动

家庭环境复杂,让机器人理解空间指令难,现有VLM多聚焦2D推理。北航、北大等联合推出多模态大模型RoboTracer,能精准生成3D轨迹,在多项评测中领先,还能直接集成到机器人,完成复杂任务。

机器之心
算法论文8

Coding Agent 自主解题很强,但用户改一行代码就"翻车"?自所团队提出 SWE-Touch 揭示共享工作空间下的能力缺口

当前基于大模型的Coding Agent是热门研究方向,现有评测多假设其独占代码仓库。中科院自动化所团队构建SWE - Touch框架,对9个前沿模型测试,发现用户干预下模型性能下降、排名洗牌。

深度学习自然语言处理
算法论文8

长程任务飙升98%,斯坦福Skill原生LLM来了

普林斯顿、CMU、斯坦福、牛津等提出Skill-Native大模型,提出Skill Entropy度量技能切换难度,搭建Skill²-Bench评测,还将熵用作训练信号提出Skill-Entropy RL,提升多模型准确率,且技能熵可复用。

PaperAgent
开源动态8

真可用!美团数字人模型开源,MV、电商等统统拿下

美团开源数字人视频生成框架 LongCat - Video - Avatar 1.5 版本,换音频编码器、加速推理,支持多任务与多场景。经770人评测,它在多维度领先对手,各方面表现均衡,效率与质量兼得。

AIGC开放社区
开源动态8

10 万 Star 的反常识:AI 写代码的瓶颈从来不是代码本身

GitHub上的Superpowers开源项目,半年攒10.9万Star。它是AI编程工具的工作流操作系统,让AI像工程师工作,有面试需求、细化计划等流程,内置14个技能,安装简单,理念超前但也有局限。

CourseAI
算法论文7

1美元Token撬动4800美元收益!AI挑战百万美元级基准,最赚钱的Agent出现了

Humanlaya Data Lab等机构构建$OneMillion - Bench评测基准,用经济价值衡量模型。它含400道高难题目,覆盖多领域。目前最强模型能产出约50万美元价值,但离可交付专业任务还有距离。

机器之心
新闻资讯8

2025年末全球 AI 行业流量报告:狂热退潮,分化开始

Similarweb报告显示,2025年Q4 ChatGPT流量同比跌22%。各AI产品走势分化,如Gemini涨49%,Claude坐“过山车”。AI编程、写作等领域也有不同表现,还揭示对传统行业冲击没那么快。

宝玉AI
推荐文章7

我的 2025 总结:当 AI 开始释放创造力,工程师如何重新站位

2025 年 AI 开始释放创造力,重新定义知识工作。作者在编程上向创造性工作倾斜,设计适配 AI 的架构、落地 DSL;写作上 AI 提升生产力但削弱创作欲。2026 年需探索新竞争力,实现角色转变。

phodal
新闻资讯8

李飞飞押注的3D世界模型黑科技,被这篇论文一次性扒光!

李飞飞创业公司World Labs发布空间智能模型成果,推出Marble平台。本文分享3D、4D世界模型技术综述,系统梳理原生表示的世界模型,给出分层分类法、数据集与评测指标,并开源维护。

PaperAgent