「智能体基准」共找到 4133 篇相关文章
马斯克20亿送Grok 4上火星!20万GPU造宇宙大脑,一句话生成3D黑洞
发布72小时,Grok 4爆红硅谷,2分钟可部署游戏,一句话直出完整动画。xAI成立两周年,马斯克SpaceX将投20亿,或把模型送上火星。Grok 4算力强,多项基准测试刷新SOTA。
比女皇报告还炸裂!67页AI深度调研刷屏,全球LLM大决战真正开始
硅谷财富管理巨头Iconiq Capital发布《2025年AI现状报告》,实测300家AI公司落地路径,揭示AI从概念走向实战的七大真问题,解析从构思到部署AI产品路径,核心关注高效构建、规模化落地等。
大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单
蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。
HBM Roadmap和HBM4的关键特性
文章介绍 KAIST TERALAB 公布的 HBM 技术,涵盖 HBM 路线图和 HBM4 特性。HBM 路线图展示从容量升级到计算存储融合的进化,HBM4 在电气规格、封装冷却、架构等方面有突破,AI 工具也用于研发。
不用千亿参数也能合成高质量数据!这个开源框架让小模型“组团逆袭”,7B性能直追72B
上海人工智能实验室与中国人民大学提出GRA框架,以“多人协作”理念让小模型分工生成高质量训练数据。实验显示其生成数据质量高,项目已开源。它打破对大模型蒸馏依赖,展现“集体智能”潜力。
新赋能•创生态 | 首钢园“产业跃升计划”发布会举办
在数字浪潮下,新质生产力成核心变量。5月28日,首钢园“产业跃升计划”发布会召开。其正构建“1+3+X”产业体系,园区已聚800余家科创企业。会上多位专家分享,还签约伙伴构建企业全生命周期服务体系。
DeepSeek-R1 更新,思考更深,推理更强
DeepSeek R1 模型完成小版本升级至 DeepSeek - R1 - 0528,用户可在官网、APP 等体验,API 同步更新。该版本强化深度思考能力,在多基准测评表现优异,还改善幻觉、提升创意写作等能力。
大模型下半场,阶跃凭什么领跑多模态之战
国内大模型竞争分资源派、技术派、国家队三阵营,多模态成竞争分水岭。阶跃星辰成立两年发22款自研基座模型,16款为多模态。其坚持理解生成一体化路线,在多模态领域有优势,还布局多应用场景。
换题还是第一!DM0.5横扫RoboColiseum四榜
本文报道原力灵机DM0.5在智元机器人发起的RoboColiseum具身模型评测中拿下四个单项第一,这已是该模型连续拿下六套不同类型公开评测的榜首,攻破了传统具身模型换题掉分的痛点,目前已开源落地产业场景。
Claude Fable 5.1 发布:缓存读降价 75%,但实际更贵了
Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1。Fable 5.1 性能全面上涨,但出现价格悖论,缓存读降价 75% 实际更贵。在 Agent 类任务与 Opus 5 基本持平,推出 EFS 应对数据留存争议,还有多项科研演示。