大模型预训练」共找到 9479 篇相关文章

开源动态8

世界模型和具身脑最新突破:90%生成数据,VLA性能暴涨300%|开源

国产世界模型玩家获突破,VLA模型性能涨300%,90%训练数据由世界模型生成。极佳视界开源GigaWorld - 0及训练框架,在多方面优化,经对比性能领先,还验证其生成数据对具身任务的提升作用。

量子位
算法论文8

模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制

型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。

深度学习自然语言处理
新闻资讯7

OpenAI 开源模型泄露:六技术细节

OpenAI 可能发布的开源模型细节泄露,包含两款模型,1200 亿参数 MoE 模型和 200 亿参数稠密模型,专注文本处理。还涉及训练技术、激活函数、上下文窗口、注意力机制及底层架构等方面的技术细节。

AI寒武纪
开源动态8

开源即爆火!英伟达重磅推出OmniVinci全模态模型

英伟达在华盛顿GTC会开源OmniVinci全模态语言模型,实现视觉、音频、语言统一理解。它性能超竞品,架构有创新,数据引擎庞。实验有重要洞察,在多场景表现佳,代表全新AI范式。

机器之心
新闻资讯8

Manus数十亿美元卖身Meta,智谱夺得全球模型第一股

2025年末中国AI领域有两喜事,通用AI Agent公司Manus被Meta数十亿美元收购,其发展迅速成果显著;智谱启动招股,即将成为全球模型第一股,虽研发投入高,但营收增长快,获资本青睐。

AIGC开放社区
产品应用7

神秘模型象」:仅100B拿下SOTA,Token效率超高!

神秘模型象」面纱揭开,它出自蚂蚁Inclusion AI团队,仅100B小,是同规模SOTA且省Token。经多方面实测及权威榜单评测,它快、准、省,能胜任多数日常工作,但也有不擅长的领域。

量子位
新闻资讯7

AI时代已来,魔幻的模型投毒事件,我们怎么应对?

央视315晚会曝光针对模型的蓄意信息围猎,虚构手环经力擎系统包装成科技尖货。黑产靠此吸金,利用技术污染证据链。多方已行动,厂商需提升安全能力,消费者要保持警惕。

AIGC开放社区
开源动态8

商汤科技与南洋理工开源空间智能多模态SOTA模型

商汤科技与南洋理工学构建800万量级三维空间数据集,训练出开源SOTA多模态基础模型SenseNova - SI系列。该系列模型在多个权威测试中表现出色,部分超越GPT - 5,还展现出泛化等能力,且能赋能具身智能。

AIGC开放社区
算法论文8

Meta提出StepWiser,让模型学会“反思”自己的推理过程

Meta提出StepWiser解决语言模型推理逻辑正确性问题。它训练生成式评判模型,通过强化学习在线训练,能解释推理步骤好坏。实验显示其远超传统方法,为构建可靠AI系统提供新思路。

深度学习自然语言处理
算法论文8

华人团队终结Token危机:扩散模型数据潜力超自回归三倍

最新研究发现,token数量受限下,扩散语言模型数据潜力超自回归模型三倍多。一个1B参数的扩散模型用1B tokens训练,在基准测试取得不错准确率,且未现性能饱和。

量子位