3D生成模型」共找到 9335 篇相关文章

算法论文8

省下1.25倍算力!Kimi这篇论文,可能改写所有大模型的训练方式

模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。

AI寒武纪
算法论文7

估值840亿AI实验室再放大招,他们要给大模型戴上「紧箍咒」

新智元报道,OpenAI前CTO创办的Thinking Machines Lab发布研究「模块流形」,将传统数值修正转为「预防式」约束优化。它提出新范式,为训练大模型提供新思路,还介绍了流形优化器及相关算法。

新智元
算法论文7

模型“记性差一点”反而更聪明!金鱼损失随机剔除token,让AI不再死记硬背

马里兰大学等团队提出金鱼损失法,训练时随机剔除部分token,让模型不逐字记内容,仍学语言规律。实验显示,LLaMA - 2用该方法后记忆内容减少,下游任务性能影响小。

量子位
产品应用8

帮大模型提速80%,华为拿出昇腾推理杀手锏FlashComm,三招搞定通算瓶颈

在大模型推理通算难题凸显的背景下,华为数学家祭出 FlashComm。它包含三项技术,分别在 AllReduce 通信、以存换传、多流并行方面优化,解决通信瓶颈,提升推理性能,未来还将围绕多方向创新。

机器之心
开源动态8

3行代码做出自己的数字人,GitHub爆火的国产项目你用上了吗?

中国硅基智能推出HeyGem与DUIX两大开源项目,在GitHub引发热潮。HeyGem能快速克隆数字分身、生成4K视频,DUIX支持实时交互,二者构建完整技术闭环,推动数字人技术普及。

开源星探
算法论文8

从少样本到千样本!MachineLearningLM给大模型上下文学习装上「机器学习引擎」

新研究 MachineLearningLM 提出轻量可移植「继续预训练」框架,突破 LLM 在上下文学习局限,能学上千示例,在多领域分类任务超基准模型。它有三项核心创新,效果惊艳且应用潜力大,还指明未来研究方向。

机器之心
新闻资讯8

马斯克首个编码模型上线,编程飙进Top5!这9位华人天团爆肝打造

xAI上线首个编码模型Grok Code Fast 1,速度快且性价比高,在编程基准测试中冲进前五。它全栈开发能力出色,背后核心团队华人学者占多半,xAI还给出提示词编写指南。

新智元
新闻资讯8

“最强编码模型”上线,Claude 核心工程师独家爆料:年底可全天候工作,DeepSeek不算前沿

Anthropic 开发者大会发布 Claude 4 ,含 Opus 4 和 Sonnet 4 型号,在基准测试表现出色。核心工程师预测年底软件工程智能体能力,谈 RL 及 DeepSeek,还提到模型自我意识、推理计算瓶颈等问题。

InfoQ
新闻资讯8

一年4次迭代,狂堆GPU成真!微软AI冷液灌芯,散热暴涨3

AI芯片发热问题严重,限制了其发展。微软推出微流体冷却技术,在芯片内开液体血管,散热效率最高提升3倍,温升降65%。一年4次迭代解决诸多难题,影响从省钱到使用体验,更是抢跑未来的布局。

新智元
算法论文8

终结多智能体视觉幻觉“滚雪球”!新国立等提出ViF:无需改造模型,即插即用

多智能体协同做视觉任务常轮次越多错得越离谱,根源是信息传递方式有缺陷。新国立等研究人员提出轻量通用的ViF范式,无需改造基座模型,可大幅压制幻觉滚雪球,已入选ICLR 2026。

量子位