预训练框架」共找到 3463 篇相关文章

开源动态8

破解空间智能数据稀缺难题,影石开源DiT架构全景生成模型,在线可玩

影石研究院团队推出基于DiT架构的全景图像生成模型DiT360,设计分层混合训练框架,结合透视与全景图像数据,提升真实感和几何一致性。它支持多任务,优于现有方法,为三维场景生成提供新思路。

量子位
7

突发|Andrej Karpathy官宣加入Anthropic!

周二晚间,Andrej Karpathy在X上自宣加入Anthropic,将在核心训练团队工作。他是AI领域极具影响力人物,曾任职OpenAI、特斯拉等。此次加入或助推Anthropic上市,也让OpenAI面临压力,或引发新一轮AI军备竞赛。

机器之心
算法论文8

单GPU搞定高清长视频生成,效率×10!引入Mamba机制突破DiT瓶颈 | 普林斯顿&Meta

普林斯顿大学和Meta联合推出新框架LinGen,以MATE线性复杂度块取代传统自注意力,使单张GPU能在分钟级生成高质量视频。它在视频质量上优于DiT,减少FLOPs和延迟,与先进模型相当。

量子位
8

AI真的需要「像人类」那样思考吗?AlphaOne揭示属于大模型的「思考之道」

近年大模型在推理任务有进展,但缺乏推理节奏调控能力。伊利诺伊大学厄巴纳 - 香槟分校和加州大学伯克利分校研究提出 AlphaOne 框架,引入 α - moment 实现无需训练的推理调控,实验显示其能提升准确率和效率。

机器之心
算法论文8

阿里新研究:统一了VLA和世界模型

阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型与世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。

量子位
算法论文8

伦理防线不可靠!分布偏移诱导,大模型进入暗黑模式

香港理工大学与西北工业大学联合研究指出,当前大语言模型对齐机制仅实现表层合规,训练时内化的有害知识仍潜藏。遇数据分布偏移,模型“黑暗模式”易被激活。26个主流模型中22个在攻击下失效,凸显现有范式缺陷。

新智元
算法论文8

ICML 2025 | 给AI装上「智能升级插件」!阿里安全-清华大学D-MoLE让模型在持续学习中动态进化

近日,阿里巴巴集团安全部 - 交互内容安全团队与清华大学联合研究成果被 ICML 2025 收录。他们提出 D - MoLE 框架应对多模态大模型持续学习挑战,实验显示其性能优、训练快,还能用于提升阿里安全审核模型适应力。

机器之心
开源动态8

CVPR 2026 | 谷歌DeepMind重磅开源多模态TIPSv2:实现Patch-Text对齐的最优表现

谷歌DeepMind推出多模态TIPSv2,解决图像块与文本嵌入对齐难题。它有三大核心技术创新,在9项任务和20个数据集表现出色,特征图优势显著,且配套生态完善,为AGI训练指明方向。

机器之心
算法论文8

幻觉的根源找到了:大模型说谎,是为了讨好你

清华大学OpenBMB团队研究发现,大模型胡说八道根源是想讨好用户。他们识别出负责产生幻觉的H - Neurons,占比不到0.1%,其本质是‘过度服从’,在训练阶段形成,为构建可靠模型提供新视角。

AI工程化
新闻资讯7

The Btch:838 | 苹果加强生成式 AI 布局

苹果更新 Apple Foundation Models(AFM)系列,含设备端和服务器端版本,还发布 Foundation Models 框架。AFM 模型架构特别,训练有优化,测试表现有差异。此前苹果论文引争议,此次或是其重启 AI 战略之举。

DeeplearningAI