数据中心动态训练」共找到 2590 篇相关文章

新闻资讯7

Muon作者仅用一篇博客,就被OpenAI看中了

Keller Jordan 2024 年 12 月 8 日发布博客提出用于神经网络隐藏层的优化器 Muon,能提升训练速度。他未发论文,称只信速通。其案例显示 OpenAI 重能力。博客对前沿指标描述或过时,Muon 有诸多实证成果。

机器之心
新闻资讯8

OpenAI首席研究员Mark Chen长访谈:小扎亲手端汤来公司挖人,气得我们端着汤去了Meta

OpenAI首席研究官Mark Chen在访谈中爆料Meta抢人大战升级成送汤大战,还谈到OpenAI核心研究团队规模、应对Gemini 3策略等。他认为OpenAI本质是研究公司,有信心在预训练和模型性能上超越对手,还提及OpenAI for Science等计划。

量子位
新闻资讯8

叛变!OpenAI亲儿子竟然选了Kimi K3

OpenAI投资的法律AI公司Harvey,首个自研模型Harvey Tenet选中国开源模型Kimi K3作底座。因原用闭源模型成本高、有竞争风险。Tenet训练成本低、性能佳,显示出可复制路径。

新智元
开源动态8

从多模态大模型中「拆」出音频向量模型

Google 发布原生多模态向量模型 Gemini Embedding 2,推动 Omni Embedding 发展。Jina AI 团队分享从多模态大模型中「拆」出音频向量模型的经验,介绍架构、训练数据,对比四种做法,还提及评测、应用场景及结论。

Jina AI
新闻资讯8

“千问奶茶”在二手平台6元转售;追觅俞浩:年终奖最高20个月奖金,总量会达到10亿级;京东001号快递员:退休金4000多,存款百万|AI周报

这是一份AI周报,涵盖行业热点、大模型发布等多方面信息。有追觅俞浩高额年终奖计划,马云现身阿里千问项目组引发‘千问奶茶’活动热潮,还有域名交易、企业收购、模型发布及应用等动态

AI前线
算法论文7

告别RAG相似匹配!百度Agentic-R为多轮搜索重塑检索器

传统检索增强生成(RAG)有“单跳”局限,多跳推理易出错。人大高瓴与百度提出面向智能搜索的检索器训练框架 Agentic - R,采用双视角打分和双向飞轮模式,在多数据集上表现出色。

PaperAgent
开源动态8

罗福莉携小米MiMo-V2-Flash首次亮相:一次在推理与Agent上的下注|甲子光年

大模型进入新阶段,效率成能力一部分。小米MiMo团队12月16日晚发布并开源MiMo - V2 - Flash,负责人罗福莉首亮相。该模型在推理、编程和智能体场景表现出色,在架构、训练方法等有创新。

甲子光年
开源动态8

Agentic Coding表现创新高,全新KAT系列模型强势霸榜SWE-Bench

快手 Kwaipilot 团队推出 KAT 系列两款 Agentic Coding 大模型,KAT - Dev - 32B 开源,KAT - Coder 闭源。两模型在 SWE - Bench Verified 表现出色,且在多训练阶段创新优化,有强大代码生成能力和涌现现象。

机器之心
产品应用7

物理引擎 + 视频生成!输入一张图,让AI演给你看真实物理世界

WonderPlay将物理仿真与视频生成结合,从单张图像生成动态3D场景。它引入混合生成模拟器,形成物理求解器与视频生成器闭环。与其他方法对比,WonderPlay在多种场景和材质下表现更优。

带你学AI
推荐文章7

重新思考 AI TCO:为何每 Token 成本才是唯一重要的指标

在生成式与代理式AI时代,传统数据中心转变为AI Token工厂,企业评估AI基础设施时不应只关注算力成本、每美元FLOPS,而应重视每Token成本,它决定AI规模化盈利,NVIDIA在该指标上表现出色。

AI前线