「基准数据集」共找到 3265 篇相关文章
本文关注vllm V1中管控模型分布式推理的Executor部分,介绍其类型、Executor-Workers架构及数据传输机制,对比V0架构优势,以单机多卡的MultiprocExecutor为例展开讲解,还提及不同数据量的传输方式及相关代码。
向量数据库要被取代?DynamoDB 开始原生支持 AI 搜索
Amazon DynamoDB 推出原生向量搜索,允许开发者将嵌入向量与应用数据存一起,直接在其中运行近似最近邻查询,无需单独向量数据库。介绍了功能特点、成本计费及开发者反馈等。
马斯克曝光Grok 5!1.5万亿参数,偷师Cursor狂练编程
5月25日凌晨马斯克官宣,1.5万亿参数Grok V9-Medium训练完成,2 - 3周后发布。训练灌入大量Cursor编程数据,编程能力将大幅提升。此前v8 - small年底前开源,马斯克编程赛道布局全面摊牌。
Cursor即将被收购、Figma股价大跌,模型厂商还会吃掉谁?AI应用存在护城河吗?
SpaceX 或 600 亿美元收购 Cursor,Anthropic 上线竞品致 Figma 股价跌 7%。AI 应用公司原以为的数据飞轮、垂直 fine - tune、AI 原生 UX 等护城河逻辑已松动,威胁或来自模型供应商。
Meta正炼化老板:24小时不间断工作,扎克伯格真成机器人了
《金融时报》爆料,扎克伯格正将自己炼成“代理CEO”扎克bot,由其影像和语音数据训练,本人也参与其中。超级智能实验室攻克相关技术难题,Meta还开发“CEO Agent”,但项目上线或面临问题。
MMLU已死?「人类最后考试」登Nature:全球AI模型集体不及格!
AI发展迅猛,现有基准测试难以跟上其步伐。近1000名研究人员组成的全球联盟创建「人类最后的考试」(HLE),涵盖多领域难题,目前最强AI准确率不足50%,凸显AI与人类专家的差距。
端到端智驾新SOTA | KnowVal:懂法律道德、有价值观的智能驾驶系统
北京大学王勇涛团队提出新型自动驾驶系统 KnowVal,通过感知与知识检索模块协同实现视觉 - 语言推理。它构建驾驶知识图谱,有价值模型用于轨迹规划,实验在多基准测试表现佳,还通过定性分析验证效果。
金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%
2025年6月以来多模态文档解析成前沿课题。MonkeyOCR v1.5是全新框架,在OmniDocBench v1.5等基准上全面突破,复杂表格等场景提升9.7%,采用两阶段解析管道和复杂表格处理方案。
HumanSense:探索多模态推理边界,打造「察言观色会共情」的全模态交互伙伴
蚂蚁集团与西安交通大学联合提出并开源 HumanSense,含评估基准与推理模型。通过细粒度评测、全模态消融等研究,提出优化策略,项目已在 GitHub 和 HuggingFace 开源,推动 AI 交互体验革新。
Flash-Searcher:Web Agent的并行革命
当下Web智能体用顺序执行链解决复杂任务存在执行和信息利用率低的问题。为此提出Flash - Searcher,以DAG并行执行机制为核心,提升执行吞吐与速度,在多基准上表现优,代码已开源。