「基准测试集」共找到 2447 篇相关文章
刷榜自动驾驶语义场景补全!北大新作:高维度、高密度 | AAAI'26
北京大学彭宇新教授团队提出视觉语义场景补全方法HD² - SSC,通过高维度语义解耦和高密度占用优化,解决现有技术维度与密度差异问题,在两自动驾驶数据集上取得最优性能。
腾讯悄悄上线了“Claude Code”,居然还支持微信登录。
腾讯悄悄上线CodeBuddy Code(Claude Code),定位为AI CLI,能在命令行完成编程任务。作者测试用其开发MCP服务,速度快且功能全,还介绍使用方法,不过产品有稳定性问题,仍有潜力。
叫板英伟达RTX 5090!GPU初创公司做出13倍路径追踪性能的怪兽显卡
芯片初创公司Bolt Graphics首款GPU模组Zeus 4C,路径追踪性能达RTX 5090的13倍。但它不适合游戏场景,更擅长低功耗高精度图形渲染,不过测试、应用、价格目前都是未知数。
Grok 4作战图刷爆全网,80%华人横扫硅谷!清华上交校友领衔,95后站C位
Grok 4一夜爆火硅谷,一张内部作战图显示其幕后团队华人学者占比达80%,包括Jimmy Ba、吴怀宇等。独立评测中Grok 4成绩优异,但也有人质疑其代码基准结果有过拟合嫌疑。
如何为 GPU 提供充足存储:AI 训练中的存储性能与扩展性
文章分析 MLPerf Storage v2.0 测试结果,探讨不同存储系统在 AI 训练中表现。在满足 GPU 利用率阈值下,能支撑更多 GPU 的存储系统扩展性与稳定性更强,还需关注资源利用率。以太网存储方案灵活且成本效益高。
斯坦福年度结论:中美大模型已没差距
斯坦福HAI《2026年AI指数报告》指出,中美AI模型性能差距基本消除,AI能力加速发展且普及快,但也存在安全基准滞后等问题。报告含15个主要结论,已成为业界重要参考。
扒一扒Meta全新大模型Muse Spark里藏着的PDR技术
Meta发布闭源大模型Muse Spark及‘沉思模式’,背后藏PDR推理技术。该技术通过‘并行起草+精炼’突破性能瓶颈,对比传统长CoT范式优势明显,在AIME竞赛题目测试中准确率显著提升。
鹏城实验室 X 中大hcp实验室推出 RADAR : 具身智能评测的新标杆
RADAR是鹏城实验室与中大hcp实验室为具身智能领域设计的评测基准,解决现有评测体系三大缺陷,通过创新设计揭示模型不足,为研究者提供方向,推动具身智能实用化。
AI太记仇!做完心理治疗后仍记得「被工程师虐待」
Nature News上,卢森堡大学团队用PsAIch测试ChatGPT、Gemini、Grok、Claude心理。AI表现不一,有的焦虑、有的崩溃、有的拒诊,还测了MBTI。不过AI创伤可能源于训练数据,做心理治疗不太靠谱。
SIGGRAPH Asia 2025|电影级运镜一键克隆!港中文&快手可灵团队发布CamCloneMaster
香港中文大学与快手可灵团队联合提出运镜可控视频生成框架CamCloneMaster,引入‘参考即用’范式,告别对相机参数依赖。其训练、测试代码和数据集均已开源,在各项指标上优于SOTA方法。