「SOTA结果」共找到 885 篇相关文章
Meta Shuffling的MoE Grouped GEMM kernel benchmark
作者拷贝fbgemm开源的moe grouped gemm kernel,修复小bug后与SGLang的Grouped GEMM Triton Kernel对比,结果显示fbgemm在MoE模型上性能提升显著,可应用到SGLang的ep - moe的grouped gemm kernel中。
英伟达发现RL Scaling!创造力暴涨,做基座模型做不了的事!
过去学界争论强化学习(RL)对语言模型的作用,此前研究认为其效果有限。本文发现问题出在训练时间短,提出ProRL,让训练突破2000步以上,结果惊人,小模型也能有出色表现。
从性能到实战,怎样才算是靠谱的 Agent 产品?
红杉中国团队提出AI基准测试工具Xbench,其双轨测评体系不再单纯执着于测评问题难度,重点量化AI系统在真实场景的效用价值,还构建长青评估机制,以确保评估结果的时效性和相关性。
18年前不让你苦修PS的美图,这次不让你苦修AI了
当前AI创作门槛渐高,美图在影像节推出8款AI产品,让用户少学技能拿结果。产品围绕交付成果,定位不同但本质相同。美图还在商业模式、组织架构上转变,市场成绩亮眼。
汉字防AI作弊!甩英文、拉丁文十几条街
中科院等联合发布 Chronicles-OCR 基准测试,让 20 多个主流视觉大语言模型识别汉字演变史。结果显示,模型在古文字识别上表现糟糕,还存在靠认材质作弊情况,暴露了 AI 理解汉字的局限。
Claude不到4%,全军覆没!一场大考撕碎Agent「全自动办公」幻想
新智元报道,UniPat AI的SaaS - Bench实战考卷,用23个真系统、106个任务测试Agent。结果显示,Claude Opus 4.7完全通过分数仅3.8%,多数模型全军覆没,暴露了Agent在真实环境中的四种致命缺陷。
大模型能复刻这些系统吗?ProgramBench给出了残酷答案
斯坦福NLP组发布ProgramBench,用200个完整代码库重建任务测试主流大模型,要求模型仅根据可执行文件还原如SQLite等项目完整代码,结果所有模型实际解决率为0%,说明模型更擅模仿代码表面结构。
搜索已死?被AI投毒搞怕了的我开始重新看待百度
作者辅导孩子背诗遇读音疑问,问AI结果更懵,百度则给出清晰准确答案且标注来源。原因在于AI基于大模型‘概率预测’易‘编答案’,百度用‘双层Agent’架构结合内容治理,答案更靠谱。
在 RDS PostgreSQL 中实现 RaBitQ 量化
本文介绍在阿里云 RDS PostgreSQL 上,pgvector 能力进一步增强,引入 RaBitQ 量化提升其在大规模向量场景下的表现。分析了 pgvector 面临的挑战,阐述 RaBitQ 原理、优势,给出性能测试结果及快速上手的 SQL 操作。
分享2篇最新Harness论文,一篇谷歌,一篇微软
在LLM Agent迅速发展的当下,如何为其设计合适的Harness成关键问题。本文分享微软M⋆和谷歌AutoHarness两篇论文,分别从记忆系统和动作约束维度提出自动化的Harness进化方法,并介绍了实验结果。