「测试效率」共找到 2804 篇相关文章
大模型再爆弱点!旧记忆忘不掉,新记忆分不出,准确率暴降 | ICML'25
弗吉尼亚大学和纽约大学研究人员用「前摄干扰」概念设计测验PI - LLM,测试大语言模型(LLM)上下文检索能力。结果显示,随干扰增加,模型准确率对数下降至零,提示工程效果有限,需调整模型架构或训练范式。
【博客转载】CUDA Shared Memory Swizzling
文章讨论用swizzling技术处理CUDA共享内存bank冲突,它可重排索引映射避免冲突且不浪费内存。以矩阵转置为例,对比有冲突、填充、swizzling三种实现,还分析了swizzling和填充优缺点。
拳打可灵,脚踢 Veo 3,谁是物理世界的「懂王」?
多模态视频生成大模型是复杂系统工程,多为巨头游戏。MiniMax的Hailuo 02发布,ELO得分超谷歌Veo 3和快手Kling 2.0。它能呈现复杂运动,处理物理关系,提升训练推理效率,成本低,后续还将更新。
AI七个月突破数学家“围剿”反超人类!14位数学家深挖原始推理token:不靠死记硬背靠直觉
大模型o3 - mini - high在7个月内,于FrontierMath基准测试中,答题得分从2%提升到22%,超人类团队平均水平。数学家分析其推理记录,发现它靠直觉而非死记硬背解题,但也存在缺乏创造力等局限。
时隔一年,再次使用7个国产AI大模型写高考作文,国产模型的进步也太大了!有彩蛋。
去年评测国产模型写高考作文能力时,各模型问题不少,如用词重复、字数不足。今年再次测试7个国产模型,能力有指数级提升,文采惊人,扣题方面通义千问和文心一言表现出色。文末还有海外模型“翻车”彩蛋。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
a16z聊AI编程:别担心被取代,新玩家、新范式带来的是「很多」机会
a16z三位投资合伙人认为AI Coding是第二大AI市场,有望成最大单一市场。他们对编程未来不悲观,指出新人群与新方法或催生新软件形态,编程语言不会被取代,资深工程师仍被需要。
腾讯 Hy3 一手实测,Agent 能力提升不止一点
作者拿到 Hy3 模型测试资格,介绍其架构、性能和价格优势,还在 WorkBuddy 里实测它完成运营工作、选编辑助教、开发新功能等任务的效果,最后评价 Hy3 能力、价格、适配方面的表现,并分析 WorkBuddy 领先原因。
【独家】对话汤元科技任冬淳:物理AI的瓶颈,在于训练体系|甲子光年
对话汤元科技任冬淳,探讨物理AI瓶颈。他认为物理AI瓶颈在训练体系,要满足数据结构质量、训练验证闭环、数据规模效率三要求。汤元构建训练底座,为具身智能和智驾提供服务,具身智能是未来重心。
极端天气也不怕漏检!RDA-YOLO:面向微小绝缘子缺陷检测的鲁棒动态自适应网络
文章指出传统绝缘子检测方法面临人工巡检效率低、小目标检测难等挑战,现有YOLO系列算法也有局限。为此提出RDA - YOLO网络,在YOLOv8基础上有三项创新,实验显示其精度、速度和极端天气鲁棒性表现出色。