编程基准」共找到 1887 篇相关文章

算法论文7

AI的记忆问题解决了!最强记忆基准99%的准确率

Supermemory团队构建的实验性AI智能体流程,在LongMemEval基准测试中达近99%准确率。其技术摆脱传统限制,以新方式处理信息。ASMR创新数据摄取和检索管道,有两种回答流程,团队计划开源代码。

AIGC开放社区
新闻资讯8

NVIDIA团队让编程Agent接管真实机器人实验,成功率达99%

NVIDIA GEAR 实验室负责人介绍 ENPIRE 项目,首次在机器人硬件实现自动化研究。让 8 个 Codex Agent 驱动闭环,完成高精度任务,成功率 99%。项目计划开源,还提出 MRU 与 MTU 指标。

机器之心
新闻资讯7

Andrej Karpathy:一场里氏 9 级的大地震正在重塑整个编程行业

文章围绕AI在编程领域的应用展开,作者与大师交流AI Coding方式,后提及Andrej Karpathy观点,指出编程行业正被重构,程序员需掌握新抽象层,应对不稳定智能系统。

MacTalk
产品应用8

爽!AI编程2年半,终于用上了喂饭级的API!

作者分享对接智谱API的超爽体验,5分钟搞定。强调在Agent工作流里文档质量影响成功率,对比某作图API凸显差距。指出2025年后AI Agent成API主要用户,智谱和Cloudflare站对边,体现Agent First思维。

AI产品自由
新闻资讯8

Science重磅:AI编程新手与资深开发者之间的差距巨大

《科学》杂志发表的AI编程全球调查研究显示,美国程序员提交的Python代码中29%由AI代笔,资深开发者借此拉大与新手差距。研究团队用GraphCodeBert模型分类器扫描代码,揭示技术扩散差异与隐忧。

AIGC开放社区
产品应用8

告别碎片化日志:一套方案采集所有主流 AI 编程工具

在AI编程工具普及的当下,有效采集和分析AI代码生成数据成重要课题。该文介绍一套基于MCP架构的多AI工具代码采集方案,支持多种工具和操作系统,有轻量化、用户无感等特点,已和Aone合作。

阿里云开发者
新闻资讯8

刚刚,OpenAI 发布 GPT‑5-Codex 新模型,专为编程而生

OpenAI 发布专为 Agent 编程优化的 GPT-5-Codex 新模型,在动态思考、性能、代码审查等方面表现出色。同时,Codex 平台大升级,集成 GitHub,保障安全隐私,还公布了定价与可用性。

AGI Hunt
算法论文7

视频模型假装在推理?MME-CoF新基准评估12个推理维度

视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。

新智元
算法论文7

AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板

MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。

量子位
开源动态8

AI编程Token消耗降低神器:RTK(Rust Token Killer)实战指南

文章介绍RTK(Rust Token Killer),它能在CLI命令输出到LLM上下文前智能过滤压缩,节省60 - 90%Token。文中说明了其原理、特性、压缩策略,还给出安装配置步骤、实测数据及使用建议。

机器学习AI算法工程