视频预训练模型」共找到 8436 篇相关文章

算法论文8

告别单一大模型依赖!北航等机构发布综述:大语言模型集成(LLM Ensemble)

北航等机构发布的论文系统性回顾了LLM Ensemble领域进展,介绍分类法、相关问题、方法、基准、应用和未来方向。LLM Ensemble指推理阶段综合利用多模型优势,现有推理前、中、后三大集成范式。

PaperAgent
推荐文章7

DeepSeek-R1发布100天后:全面复盘推理大模型复现研究及未来!

推理语言模型(RLMs)发展显著,DeepSeek - R1发布引发广泛影响且未完全开源。MiroMind等总结其复现研究,关注SFT和RLVR方向,介绍数据构建、方法设计、训练过程细节及实验关键发现。

PaperAgent
算法论文8

突破后训练瓶颈?Meta超级智能实验室又一力作:CaT解决RL监督难题

AI后训练依赖监督微调或程序化检查器,但很多有价值任务缺这两种资源。Meta超级智能实验室等机构研究者提出CaT方法,把推理时额外计算当教师信号,为大模型提供监督,实验显示效果显著。

机器之心
算法论文8

NeurIPS 2025 Best Paper | 扩散模型不为人知的“时间差”:为什么先学会创作,后学会抄袭?

深度学习中,扩散模型能生成新图像且抗过拟合。巴黎高师和博科尼大学研究团队论文指出,这源于隐含的动力学正则化,训练分两阶段,数据量增加会拉开‘泛化窗口’,还给出数学解释。

深度学习自然语言处理
开源动态7

从GPT-2到gpt-oss,深度详解OpenAI开放模型的进化之路

OpenAI 近日发布 gpt-oss-120b 和 gpt-oss-20b 两个开源模型,Sebastian Raschka 发布博客对其详细分析,回顾自 GPT - 2 以来 AI 社区进步,还与 Qwen 3 比较,介绍架构、训练、推理等细节。

机器之心
新闻资讯8

刚刚,谷歌摊牌:Genie 3让你1秒「进入」名画,人人可造交互世界!

谷歌新发布Genie 3世界模型,能从文本生成交互式AI空间世界,操控图像和视频。用户可进入《苏格拉底之死》《夜游者》等名画探索,还能利用它训练3D模型,实现沉浸式体验。

新智元
推荐文章7

大语言模型高考数学拿高分靠强化学习,那文科考高分得靠什么?

大语言模型在高考数学拿高分靠强化学习,但文科题无标准答案,此方法行不通。豆包1.6系列高考文科全科获683分,靠训练数据、思维链、长上下文和多模态直接读图等因素。

宝玉AI
新闻资讯8

xAI 全员大会实录:递归自我改进、5000 万视频/天、月球上的质量驱动器

本文是 xAI 全员大会实录,覆盖公司核心业务,如重组为四大方向、编程模型递归自我改进、Imagine 视频生成使用量等,还提及 X App 增长、太空愿景等,也指出公司存在高层流失、项目落地不明等问题。

宝玉AI
算法论文8

腾讯混元团队最新研究:让 AI 从「固定模型」走向「实时适配系统」

腾讯混元团队提出论文《HY-WU (Part I)》,尝试让模型在推理阶段根据输入实时动态生成适合任务的参数,而非依赖固定参数。通过多类实验验证,这种方式在图像编辑等任务中有明显优势,还降低了训练复杂度。

AI科技评论
开源动态8

破解空间智能数据稀缺难题,影石开源DiT架构全景生成模型,在线可玩

影石研究院团队推出基于DiT架构的全景图像生成模型DiT360,设计分层混合训练框架,结合透视与全景图像数据,提升真实感和几何一致性。它支持多任务,优于现有方法,为三维场景生成提供新思路。

量子位