「生成模型规模」共找到 8812 篇相关文章
无限长、零掉帧!StableAvatar口型同步全新技术
当前音频驱动头像视频生成扩散模型合成长视频时难兼顾音频同步与身份一致,瓶颈在音频建模。复旦大学提出StableAvatar,首个端到端视频扩散Transformer,能无限时长生成,还介绍原理与演示效果。
没想到,音频大模型开源最彻底的,居然是小红书
近几个月,开源成AI社区焦点,国内厂商七八月开源多款大模型,但音频生成占比小。小红书技术团队自去年起在音频领域稳定开源,成果覆盖TTS、ASR方向,具商用属性,降低落地门槛。
拯救P图废柴,阿里上新多模态模型Qwen-VLo!人人免费可玩
昨夜阿里推出全新多模态模型Qwen-VLo,在原有能力上全面升级,有细节捕捉、图像编辑、多语言支持等亮点,不受固定格式限制。官方demo展示多种玩法,目前免费可玩,实测其编辑能力不错。
李飞飞又被超越了?百万「普通视频」打造通用4D世界模型!
全行业为昂贵多视角数据发愁时,中科院和CreateAI推出NeoVerse,用百万单目视频打开4D世界模型大门。它抛弃多视角数据和离线预处理,解决扩展性瓶颈,在重建速度、生成质量等方面表现出色,有丰富下游应用。
让外部知识“长入”模型:动态化与参数化 RAG 技术探索
检索增强生成(RAG)成大语言模型利用外部知识主流范式,但传统方法将其当黑箱,忽略动态需求和机制鸿沟。艾清遥博士介绍动态化和参数化检索增强技术,可提升准确性与适应性,减少计算开销。
75%预训练数据都能删!Jeff Dean新作:全自动筛除低质量数据
Google DeepMind团队开发的DataRater可全自动评估数据质量,用元学习筛选有价值数据,提升模型训练效率。它能减少计算量、提高性能,在低质量数据集效果佳,还能跨模型规模泛化。
OpenAI 盲测新模型不如 Nano Banana Pro?曝 Altman 要暂停 Sora,死磕 ChatGPT
近日,网友发现 Notion 或在测试 GPT - 5.2。OpenAI 盲测新图像模型‘Chestnut’和‘Hazelnut’,结果接近 Nano Banana Pro,但生成图未获好评。Altman 调整战略,暂停 Sora 死磕 ChatGPT,本周将推 GPT - 5.2。
NVIDIA技术沙龙 《大规模EP优化:PD分离MoE并行方式》课程笔记
本文是NVIDIA技术沙龙课程笔记,介绍大规模EP优化的PD分离MoE并行方式。涵盖PD分离、大规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构性能特点与优化策略,以及各技术工作流程和效果。
碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强
国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。
Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转
Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。