基准测试数据集」共找到 1347 篇相关文章

算法论文8

一句话生成无限逼真3D场景!匹兹堡大学新作直击VLM空间推理软肋丨CVPR'26

VLM在3D空间推理上表现不佳,且缺乏合适测试基准。匹兹堡大学团队提出InfiniBench框架,用LLM Agent迭代优化和聚类策略,可按需生成3D场景,还能精准定位大模型空间推理缺陷。

量子位
新闻资讯7

想进OpenAI?先解出这道题,百万美元算力已就位

OpenAI发起Model Craft Challenge「Parameter Golf」项目,要求在固定数据上降验证损失,模型产物控制在16MB内,8张H100 GPU 10分钟完成训练。提供百万美元算力,6月招早期人才,挑战3月18日至4月30日。

机器之心
算法论文8

痛点突破:YOLOv26引入AAttn区域注意力机制,精度提升1.3个百分点

文章介绍YOLOv26引入AAttn区域注意力机制,解决传统机制在复杂场景下的不足。它通过划分特征图区域学习权重,提升检测精度,且实现简单。经实验验证,精度提升显著,还给出实现细节与优化建议。

机器学习AI算法工程
算法论文7

新研究重新评估 AGENTS.md 文件在 AI 编码中的价值

苏黎世联邦理工学院新论文指出,`AGENTS.md` 文件可能常阻碍 AI 编码智能体。研究构建 AGENTbench 数据测试,发现 LLM 生成文件降低性能,人类编写文件有边际收益但也增加成本,开发人员对此研究看法不一。

InfoQ
算法论文8

代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈

ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。

新智元
算法论文8

ICLR 2026 oral | AI代码真能进生产环境?SwingArena:从「写对代码Commit」到「通过CI审查」

过去一年大模型写代码能力提升,人们思考其能否参与软件工程核心流程。现有评测基准有缺失,SwingArena填补空白,将博弈引入评测,设计检索增强流水线,其开源后或成评估AI编程能力新工具。

机器之心
算法论文8

破解机器人「慢半拍」难题:南洋理工解决VLA致命短板,动态世界断层领先

南洋理工大学NTU S-Lab团队提出DynamicVLA,解决主流VLA模型在动态场景下反应迟缓等问题。它从多层面设计,构建自动化数据体系和DOM Benchmark,在实验中多维度领先。

机器之心
算法论文8

登顶Hugging Face论文热榜,LLM重写数据准备的游戏规则

企业数据团队面临数据准备难题,传统方法依赖人工规则,有诸多局限。上海交通大学等机构研究团队综述指出,LLM正推动数据准备从“规则驱动”向“语义驱动”转变,还给出技术选型、评估基准及工程指南。

机器之心
算法论文8

像开发软件一样造世界,Agent2World来了,把世界模型做成可运行的符号环境

为让模型真正“能行动”,需可执行、可验证的符号世界模型,但现有自动生成路线有困局。研究团队提出 Agent2World,经实验验证有显著效果,能稳定产出高质量符号世界模型,开辟 AI 理解现实环境新可能。

机器之心
推荐文章8

AI热点选品:当推荐系统遇上“热点”,我们需要一场变革

文章指出当下推荐系统追踪热点滞后,存在时效、解码、迭代困境。为此启动热点AI选品项目,构建自动化热点响应系统,经多环节处理输出优质候选,还介绍成果、后续优化方向及AIGC图像生成方案。

阿里云开发者