视频预训练模型」共找到 8436 篇相关文章

算法论文8

北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026

北大王选所彭宇新团队在论文中提出TARA方法,引入生物分类学知识与多模态模型中间表征对齐。实验显示,TARA能提升模型层级识别和未知类别识别能力,还可加速训练收敛,计算开销小。

AI科技评论
算法论文8

ICLR 2026 | 异常需要定义!中传团队提出开放世界视频异常检测新范式

现有视频异常检测(VAD)方法泛化能力不足,无法适应开放世界需求。中传吴晓雨团队在ICLR 2026发表论文,提出LaGoVAD模型,联合建模视频与异常定义,解决样本密度下降等问题,实验显示泛化性强。

机器之心
开源动态8

不用人类手写训练框架了!AI自己写代码,训出1B端侧「小钢炮」

5月25日,面壁开源端侧文本基座大模型MiniCPM5 - 1B,主打低成本部署等。它由AI编写的ForgeTrain框架参与预训练,效果与英伟达Megatron对齐且速度快10%。该模型在榜单表现优,应用边界广,部署门槛低。

机器之心
算法论文8

首个时空时序推理框架:让大模型真正读懂时空数据 | ACL'26

STReasoner是首个结合时间序列、空间结构和自然语言的推理模型,能识别异常源、追踪影响路径。研究团队构建数据生成框架和评测基准,采用三阶段训练策略,模型在多任务表现优,成本低且泛化能力强。

新智元
开源动态8

图文跨模态“近视”问题破局:360开源新模型 FG-CLIP,实现细粒度图文对齐突破|ICML2025

360人工智能研究院发布 FG - CLIP 模型,攻克图文细粒度对齐难题,成果被 ICML 2025 接收并开源。它采用双阶段训练等策略,在多任务评测中超越对比模型,推动跨模态研究产业化落地。

AI科技大本营
产品应用8

世界模型原生新一代范式!极佳视界斩获全球第一后,GigaBrain-0.5M*再进化

具身世界模型新一代原生范式登场,GigaBrain-0.5M*在多真实机器人任务中数小时零失误。它依托世界模型,创新引入人在回路机制,研发采用四阶段闭环训练流程,优势显著。

机器之心
产品应用8

百度用50天将视频价格打到行业70%!内部负责人:成本优化还有空间

8月21日百度蒸汽机音视频一体化模型重大升级,实现多人有声视频一体化生成。有五大核心技术突破,价格低至行业70%。源于算力和工程优化积累,未来还会优化成本,其盈利不依赖调用次数,带动平台生态升级。

AI前线
算法论文8

4B模型幻觉抑制能力超越GPT-5,CMU等提出行为校准强化学习新方法

大语言模型幻觉问题是部署难题,CMU等研究人员提出行为校准强化学习新方法,重新设计奖励函数。经训练,40亿参数模型幻觉抑制力超GPT - 5,实验证明该方法效果显著,还带来理论洞察。

机器之心
产品应用8

华为盘古首次露出,昇腾原生72B MoE架构,SuperCLUE千亿内模型并列国内第一

当前传统 MoE 有专家激活不均衡问题,华为盘古团队提出 MoGE 解决。基于此架构的盘古 Pro MoE 大模型在昇腾集群高效训练,推理性能强,在 SuperCLUE 榜单千亿内模型并列国内第一,赋能业务落地。

机器之心
算法论文8

腾讯与中科院联合提出R-4B,一个能自动决定是否思考的多模态大模型

多模态大语言模型“始终思考”模式有缺陷,腾讯混元团队与中科院自动化所联合提出R - 4B,通过双模式退火训练和双模式策略优化实现自动思考,在多评测中达SoTA,省资源且效果好。

深度学习自然语言处理