后训练课程」共找到 3794 篇相关文章

产品应用8

国产AI首次「长出」原生记忆,非Transformer架构成新王!机器狗当场引爆WAIC

WAIC世界人工智能大会上,国产黑马RockAI的大模型Yan 2.0 Preview亮相,可多终端无损部署。它基于非Transformer架构,训练效率高,有原生记忆,实现端侧AI,展现出自主学习和多模态能力,引发关注。

新智元
算法论文7

Gemini 2.5 Pro 是怎么炼成的?-- gemini 2.5 技术报告阅读笔记与思考

文章是 Gemini 2.5 技术报告阅读笔记。介绍其成功点有多模态、LongContext、思考能力;还阐述模型结构、训练和数据情况,以及代码、事实性、长上下文等特定能力的提升,最提到基于其构建的智能体。

chaofa用代码打点酱油
新闻资讯7

Muon作者仅用一篇博客,就被OpenAI看中了

Keller Jordan 2024 年 12 月 8 日发布博客提出用于神经网络隐藏层的优化器 Muon,能提升训练速度。他未发论文,称只信速通。其案例显示 OpenAI 重能力。博客对前沿指标描述或过时,Muon 有诸多实证成果。

机器之心
新闻资讯7

国内“内卷”没用,企业怎么靠AI出海获利?

InfoQ《极客有约》X AICon 直播探讨中国技术出海破局增长。嘉宾认为企业要判断国内经验能否迁移海外,还分享出海成功案例,给出战略选择建议,如先欧美国内等,还提及验证产品的关键指标。

InfoQ
新闻资讯8

OpenAI首席研究员Mark Chen长访谈:小扎亲手端汤来公司挖人,气得我们端着汤去了Meta

OpenAI首席研究官Mark Chen在访谈中爆料Meta抢人大战升级成送汤大战,还谈到OpenAI核心研究团队规模、应对Gemini 3策略等。他认为OpenAI本质是研究公司,有信心在预训练和模型性能上超越对手,还提及OpenAI for Science等计划。

量子位
新闻资讯8

叛变!OpenAI亲儿子竟然选了Kimi K3

OpenAI投资的法律AI公司Harvey,首个自研模型Harvey Tenet选中国开源模型Kimi K3作底座。因原用闭源模型成本高、有竞争风险。Tenet训练成本低、性能佳,显示出可复制路径。

新智元
新闻资讯7

风投的钱,开始由AI科学家重新分配

近年新型AI公司NeoLab兴起,获风投开始资助外部科研。如Thinking Machines Lab、Periodic Labs推出资助项目。NeoLab先定研究问题再选团队,决策快,虽有积极一面,但也可能使少数人影响研究走向。

DeepTech深科技
开源动态8

从多模态大模型中「拆」出音频向量模型

Google 发布原生多模态向量模型 Gemini Embedding 2,推动 Omni Embedding 发展。Jina AI 团队分享从多模态大模型中「拆」出音频向量模型的经验,介绍架构、训练数据,对比四种做法,还提及评测、应用场景及结论。

Jina AI
开源动态8

罗福莉携小米MiMo-V2-Flash首次亮相:一次在推理与Agent上的下注|甲子光年

大模型进入新阶段,效率成能力一部分。小米MiMo团队12月16日晚发布并开源MiMo - V2 - Flash,负责人罗福莉首亮相。该模型在推理、编程和智能体场景表现出色,在架构、训练方法等有创新。

甲子光年
开源动态8

Agentic Coding表现创新高,全新KAT系列模型强势霸榜SWE-Bench

快手 Kwaipilot 团队推出 KAT 系列两款 Agentic Coding 大模型,KAT - Dev - 32B 开源,KAT - Coder 闭源。两模型在 SWE - Bench Verified 表现出色,且在多训练阶段创新优化,有强大代码生成能力和涌现现象。

机器之心