大模型推理训练」共找到 8431 篇相关文章

8

对话百度文库:不做大模型能直接做的事,能力积累换来竞争壁垒|AI产品Time

百度文库从文档检索平台转型为一站式AI内容获取和创作平台,付费用户超4000万,AI MAU近亿,智能PPT访问量全球第一。访谈中,负责人分享产品理念、优势及运营经验,如不走大模型能直接做的事,从用户需求出发开发功能等。

量子位
产品应用8

刚刚,全球AI生图新王诞生!腾讯混元图像3.0登顶了

LMArena竞技场发布文生图榜单,腾讯混元图像3.0夺冠,超越谷歌、字节和OpenAI等模型。它是原生多模态模型,语义理解强,核心技术独特,经多阶段训练,效果能与顶尖模型媲美。

量子位
算法论文8

面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS'25

卫星星座成数字经济时代基础设施,但运行背后规划难题待解。北航刘偲教授团队提出首个大规模真实星座调度基准AEOS - Bench,训练内嵌时间约束的调度模型AEOS - Former,为‘AI星座规划’奠定新技术基准。

量子位
开源动态8

字节清华智能体自动写CUDA内核,比torch.compile加速2.11倍

字节Seed与清华AIR团队开源CUDA Agent,在GPU内核优化基准KernelBench上成绩优异。它是大规模智能体强化学习系统,训练数据经多阶段构建,分阶段训练,全面超越商业模型,还开源了训练数据集。

量子位
开源动态7

马斯克说到做到:开源X平台核心推荐算法

X(原Twitter)开源内容推荐Feed on X召回、精排推理、策略代码,模型参数配置较小,应是简化Demo版。召回用双塔模型,精排用双层Transformer,还介绍了系统架构、模型细节等。

腾讯技术工程
算法论文7

The Batch:826 | 提高输出准确性的记忆层

通常提高大语言模型事实准确性需更大模型规模,会增加计算成本。Meta研究人员在transformer架构加可训练记忆层,可高效存储提取信息,提升计算效率,测试显示其能提升模型输出质量。

DeeplearningAI
新闻资讯7

刚刚,Claude两个新模型曝光!

开发者在Anthropic的API中发现Claude的两个新模型代号claude - marshmallow - eap和claude - melon - eap,目前处于内部测试阶段。社区有多种推测,且Anthropic命名风格改变,新模型或下月发布。

机器之心
算法论文8

超低标注需求,实现医学图像分割!UCSD提出三阶段框架GenSeg

GenSeg用AI生成高质量医学图像及对应分割标注,在仅有几十张样本时也能训练出媲美传统深度模型的分割系统,显著降低医生手工标注负担。它是通用、与模型无关的框架,可集成到现有分割模型

新智元
新闻资讯7

OpenAI推迟开源大模型发布

OpenAI联合创始人兼CEO Sam Altman宣布本周不发布开源模型,因需更多安全测试。他曾透露要推可下载、自主运行且能力强的开源模型,此前6月也因安全测试推迟发布。

AIGC开放社区
新闻资讯8

不换GPU,性能飙升2.8倍!英伟达用软件暴打摩尔定律

2026年1月8日,英伟达官网披露,基于Blackwell架构的推理软件栈升级,让混合专家模型(MoE)推理效率迎「阶跃式」突破,单GPU吞吐飙升2.8倍,显著降低推理成本。其通过软件针对性升级发挥硬件潜力,还进行多项优化。

新智元