「基准榜单」共找到 1481 篇相关文章
世界模型双冠王诞生!国产世界模型力压谷歌、英伟达等持续领跑
近日,Manifold AI 研发的世界模型 Worldscape 0.2 在 WorldArena 榜单夺冠,此前 WorldScape 0.1 也登顶 WorldScore。该模型参数规模小,进化靠 MoE 架构,展现国产世界模型实力。
NeurIPS 2025 | 蚂蚁CGM:图融合架构重塑代码大模型,探索非 Agent 新范式
在NeurIPS 2025上,蚂蚁将展示Code Graph Model (CGM)。它把代码库图结构集成到开源LLM,开启新范式,在代码库级任务上以非Agent方案登顶开放权重模型榜首,解决了复杂软件工程的Agent依赖难题。
Alibaba开源WebDancer解决DeepResearch复杂信息检索难题
Alibaba开源WebDancer,从数据和训练阶段出发提出端到端自主信息检索代理构建范式。实验中,它在GAIA和WebWalkerQA基准测试表现出色,处理复杂信息检索优势显著。
谷歌智能体发力:增强版Gemini Deep Research和专属API都来了
OpenAI强势更新,谷歌也没闲着。正式发布增强版的Gemini Deep Research,配套推出DeepSearchQA基准测试集,还发布了Interactions API,这不仅是Deep Research升级,还是Gemini生态的大升级。
Insanely Fast Whisper:开源社区让音频转录速度提升19倍
Insanely Fast Whisper工具将OpenAI Whisper转录速度提升19倍,采用Flash Attention 2技术,零质量损失。它集成多语言支持、说话人分离等实用功能,还支持跨平台,免费运行。最初是基准测试demo,值得音频处理用户关注。
Shopify 经验贴:如何搞出一个生产级别可用的 AI Agent 系统?
Shopify 以 AI 助手 Sidekick 为例,分享从简单工具调用系统演变为复杂 AI Agent 平台的经验,包括架构设计、评估方法和训练技术等方面,还给出构建生产级别可用的 AI Agent 系统的四条核心建议。
重生之我在AI时代当老板:让一群Agent互相PUA
MiniMax推出新Agent Mavis,可组建团队完成任务。其Agent Team分工明确,能解决单Agent在长程任务中的痛点,还将开源。此外,TokenPlan和Agent Plan合并,性价比提升。
做AI漫剧的、搞Agent的、投硅谷的,5.20这些赛道顶流碰头了|最新嘉宾阵容
5月20日,量子位将在北京举办中国AIGC产业峰会,主题为「@所有人,马上AI起来」。峰会聚齐百度、智谱等企业实战派,还将揭晓2026年度AIGC企业&产品榜单,发布《2026年中国AI应用全景图谱报告》。
打破瓶颈,让RAG学会思考:中科大、智源等发布推理检索框架BGE-Reasoner
人工智能浪潮下,推理密集型信息检索是RAG和AI Agent技术发展瓶颈。中科大、智源等机构联合研发推理检索框架BGE - Reasoner,在BRIGHT基准测试中刷新纪录,还将开放相关代码等推动研究。
TileLang深入详解-第一章-GPU 体系结构复习
作者借长假学习 TileLang 并撰写此文,先复习 GPU 体系结构,包括计算与线程组织、存储层次、专用指令单元,接着介绍核心性能模型与优化原理,最后给出基于 TileLang 的基准测试实践。