大模型预训练」共找到 9479 篇相关文章

新闻资讯7

一夜之间,DeepSeek V4 Pro和Grok 4.6把全球模型推入了新的斩杀线。

DeepSeek V4 Pro和Grok 4.6在两小时内发布,逼近Claude Fable 5体验。作者分享常用AI组合,分析两模型优缺点,指出它们撕开模型不可能三角,形成新斩杀线,让夹在中间的模型难受。

数字生命卡兹克
新闻资讯8

英伟达:RLP 让 AI 在预训练时就学会思考

英伟达研究团队发布 RLP 技术,与传统语言模型训练不同,它在预训练阶段就让模型学会'先想后说'。通过奖励机制自我监督,实验效果惊人,性能提升显著,不挑数据,打破了模型训练范式。

AI工程化
产品应用8

AI真能搞钱了!这家公司把模型玩成闭环赚钱机器

当全行业还在卷模型参数、烧算力时,零犀科技走出不同路。其自研因果模型,用AI智能体帮企业提升销售。2025年已实现规模盈利,成为最早跑通商业闭环的模型应用公司。

量子位
算法论文8

拒绝计算“一视同仁”!Elastic Attention:让模型学会“看人下菜碟”

现代语言模型用全注意力机制计算复杂度高,现有混合注意力策略是静态的。为此提出Elastic Attention,引入轻量级Attention Router,具备动态路由等亮点,在主流模型测试中效果好。

深度学习自然语言处理
开源动态7

OpenClaw 之后,Agentic RL有了新训练范式

模型技术推动AI从‘回答问题’迈向‘执行任务’,Agentic AI兴起。中国科认知智能全国重点实验室提出Claw - R1项目,将前沿Agent Runtime与强化学习训练框架结合,为Agentic AI提供新训练基础设施。

PaperAgent
算法论文7

AI根本守不住秘密!不依靠模型的输出过滤才是铜墙铁壁

开发者常把秘密放系统提示词,以为安全。Swept AI和密西根学团队测试发现,攻击者不断尝试,AI会泄露秘密。多种依赖模型的防御方案失败,只有输出过滤能零泄露。

AIGC开放社区
产品应用7

多模态“卷王”阶跃星辰:如何利用 JuiceFS 打造高效经济的模型存储平台

有“多模态卷王”之称的阶跃星辰,自研多模态模型,早期商业存储系统难满足需求,后引入 JuiceFS。文章介绍模型各环节存储需求,详述 JuiceFS 企业版与社区版优化实践,含模型分发、读性能等优化。

InfoQ
开源动态8

Hugging Face开源nanoVLM,750行代码可训练视觉语言模型,简单到令人发指!

Hugging Face开源全新视觉语言模型框架nanoVLM,仅750行代码就能从零训练高效能VLM模型。它在单张H100 GPU训练6小时后,在MMStar数据集准确率达35.3%,且能在免费Google Colab跑。

AGI Hunt
推荐文章8

5 分钟搞懂开源模型选型核心维度,16G显卡也能选对

文章以作者自身经历引入,指出开源模型选型易陷入‘越越好’误区。讲透选型4个核心维度,含实操步骤与避坑指南,还介绍选后评估方法,助新手快速锁定适配模型

机器学习AI算法工程
算法论文8

用更一致的轨迹、更少的解码步数「驯服」掩码扩散语言模型,扩散语言模型的推理性能和效率幅提升

扩散语言模型发展迅猛,或成下一代语言模型基础范式有力竞争者。复旦学等团队发布论文,提出高效解码策略与强化学习训练组合,解决MDLM解码和训练问题,提升推理性能与效率。

机器之心