弹性预训练」共找到 2214 篇相关文章

开源动态8

英伟达韩松团队新作:具有后神经架构搜索的高效语言模型

英伟达韩松团队推出基于后神经架构搜索的高效语言模型Jet - Nemotron,在基准测试中表现出色,准确率与Qwen3等相当甚至更优,生成吞吐量大幅加速。模型构建经多步骤优化,代码和训练模型将开源。

量子位
算法论文7

腾讯LLM团队:对下一个 Token 测的深入剖析,多样性 or 精准度?

最新研究证实RL能增强LLM推理,但成效受限训练token分布。腾讯LLM部把交叉熵重写成单步策略梯度,用超参压熵,为RL打造‘低熵高信号’起点,经实验验证低熵模型优势明显。

PaperAgent
开源动态8

清华开源首个股票k线大模型

清华开源首个股票K线大模型Kronos,是专为金融市场K线序列训练的模型,处理金融数据高噪声特性。采用两阶段框架,有安装、测步骤,还有批量测方法,项目地址为https://github.com/shiyu-coder/Kronos。

GitHubStore
推荐文章7

Dario Amodei真的很焦虑...

文章围绕Dario Amodei的采访展开,探讨AI多方面问题。他坚信计算要素假说,认为RL与训练有相似规模化现象;计一两年编码达AGI,十年内信心90%;谈AI盈利、算力采购、应用扩散等,还提及机器人革命和AGI定价。

AI寒武纪
开源动态8

超越GPT-4o和Gemini 2.5!小米MiMo-Audio音频大模型真香

小米推出MiMo - Audio大模型,训练数据超1亿小时。它在多个基准测试成开源7B模型SOTA,开放相关资源。分词器表现佳,有全新架构,在音频理解、对话、推理等方面表现出色,还集成TTS功能。

AIGC开放社区
新闻资讯8

OpenAI董事长Bret Taylor:2010 年的 SaaS 应用,就是 2030 年的智能体公司

OpenAI董事长Bret Taylor在对话中称,当下处于“加10倍速的互联网泡沫”时代,AI为初创公司带来挑战巨头的机会。他直言多数B2B公司“以客户为中心”是胡扯,还为AI创业者划红线,如应用公司训练模型是烧钱。

AI科技大本营
算法论文8

CVPR 2025 Award Candidate | 英伟达等Difix3D+:用单步扩散模型修复 3D 重建伪影

3D重建领域中,NeRF和3DGS在新视角生成时易出现伪影,影响应用。英伟达团队提出Difix3D+,将训练2D扩散模型用于3D渲染,单步去伪影,效率高、有泛化力,实验效果领先。

机器之心
算法论文8

读万卷书,大模型就能「看」懂视觉世界?Meta揭秘LLM视觉先验的起源

Meta超级智能实验室与牛津团队新论文发现,只见过文本的大语言模型(LLM)能学到可迁移到视觉任务的先验能力。研究通过超100组受控实验、耗费50万GPU小时,揭开LLM视觉先验来源,还给出训练数据配方。

机器之心
新闻资讯8

英伟达4B小模型击败GPT-5 Pro!成本仅1/36

英伟达ARC - AGI 2中,4B小模型NVARC以27.64%成绩力压GPT - 5 Pro登顶,单任务成本仅其1/36。亮点是零训练深度学习法,还靠合成数据、测试时微调等策略。小模型特定领域优化后优势明显。

量子位
产品应用7

500万次围观,1X把「世界模型」真正用在了机器人NEO身上

1X公司为机器人NEO引入1X World Model,使其学会‘想象’。该模型借助视频训练,不依赖大规模机器人数据和遥操作演示,能泛化到新场景。实验显示其在多任务上表现不错,但精细操作有挑战。

机器之心