「大模型架构」共找到 9968 篇相关文章
不换GPU,性能飙升2.8倍!英伟达用软件暴打摩尔定律
2026年1月8日,英伟达官网披露,基于Blackwell架构的推理软件栈升级,让混合专家模型(MoE)推理效率迎「阶跃式」突破,单GPU吞吐飙升2.8倍,显著降低推理成本。其通过软件针对性升级发挥硬件潜力,还进行多项优化。
LeCun在Meta的最后一篇论文
LeCun于11月11日提交最新论文《LeJEPA:无需启发式的可证明且可扩展的自监督学习》,当天其离职Meta消息曝光。论文提出LeJEPA自监督学习方法,解决表示崩溃问题,还回顾了JEPA架构发展,虽毁誉参半,但LeCun将继续推进世界模型工作。
参数砍到 1B,这个小钢炮拿下多模态第一
面壁智能发布并开源参数量仅 1.3B 的 MiniCPM-V 4.6,虽小但多模态综合能力在 1B 级别中夺冠。它推理快,效率高,靠两大架构创新实现,还为开发者提供完整工具链。
明天上市,MiniMax上市额度已经被抢疯了
大模型公司MiniMax 1月9日将敲钟上市,创下港股IPO机构认购记录,超460家机构参与认购,超额认购70多倍。它受头部基金青睐,暗盘涨幅24.6%,收入源于AI产品与服务,部分投资者看好其收支平衡。
首个地球科学智能体Earth-Agent来了,解锁地球观测数据分析新范式
上海人工智能实验室与中山大学联合研发的 Earth - Agent 解决了多模态大语言模型用于地球科学研究的痛点。它将领域知识工具封装化,利用 LLM 智能规划调度。经 Earth - Bench 评估,其在多方面表现出色,未来发展前景广阔。
RecGPT-阿里的LLM推荐系统落地方案
文章介绍阿里RecGPT推荐系统落地方案,包括召回和推荐可解释性两方向。召回采用三塔结构,通过挖掘用户兴趣生成商品标签提升召回多样性。还提及行为序列压缩、推荐归因等,以及大模型微调和评估方法。
清华系团队出手!一张 4090 即可「爆改」,1.3B小钢炮震撼开源
5月11日,清华系团队面壁智能联合多方开源端侧多模态大模型MiniCPM-V 4.6。它参数仅1.3B,性能超阿里、谷歌等同级对手,效率翻倍,还实现两项架构创新,适配主流开源生态,降低开发门槛。
对话景鲲:AI 产品的 All in One,是上下文的 All in One
Genspark 创始人景鲲在 AGI 舞台分享发展路径,其产品从 AI 搜索转型,现推出全功能 AI 办公套件。景鲲判断,未来大模型竞争激烈会商品化,AI 公司壁垒在于捕获用户工作上下文,实现「All in One」AI 工作空间。
Z-Image标准版开源:更具可塑性的图像生成全能基座
Z-Image标准版开源,它是为开发者准备的强大画板,解决了生成模型同质化问题。其保留完整权重,在微调、风格化上潜力大,采用创新架构,训练定位SFT阶段,有完整CFG支持,还提供完善工具链。
从润建、软通、新华三等头部服务商,看IT巨头AI转型的新共识|甲子光年
文章以润建股份为例,探讨传统 IT 服务商 AI 转型。润建以“曲尺”平台为支点转型,其平台覆盖全流程,“曲尺运维大模型”赋能运维。此外,软通动力、新华三也有类似转型,均结合自身优势掌握主动权。