「结构化多模态生成引擎」共找到 2631 篇相关文章
训练时间减半,性能不降反升!腾讯混元开源图像生成高效强化方案MixGRPO
混元基础模型团队提出全新框架MixGRPO,结合SDE和ODE,简化MDP优化流程,提升效率与性能。还推出更快变体MixGRPO - Flash。MixGRPO训练时间降近50%,MixGRPO - Flash再降71%,效果和效率优于DanceGRPO。
吉卜力风「手游」爆火,可灵+Midjourney生成的!教程已出,支持复刻
吉卜力风格“手游”在Reddit和推特爆火,它由AI制作,创作者用可灵AI、Midjourney结合文字提示实现效果,公开教程支持复刻。还介绍了制作方法及提示词示例,可灵AI发展势头也很猛。
中国中文信息学会大模型与生成专委会2025大模型战略研讨会成功举办
2025年6月27日,中国中文信息学会大模型与生成专委会2025大模型战略研讨会在哈尔滨举办。会议探讨技术革命、交流成果、发布基金,多位专家作报告、参与思辨讨论,聚焦大模型多方面话题。
阿里开源电影级AI视频模型!MoE架构,5B版本消费级显卡可跑
阿里开源新一代视频生成模型通义万相Wan2.2,含文生视频等功能。它率先将MoE架构用于视频生成扩散模型,5B版本可在消费级显卡部署。对比前代和Sora表现更优,还推出电影级美学控制系统。
5秒出4张2K大图!阿里提出2步生成方案,拉爆AI生图进度条
阿里智能引擎团队针对Qwen最新开源模型,将SOTA压缩水平从80 - 100步前向计算骤降至2步,速度提升40倍,5秒可出4张2K高清大图。已发布Checkpoint,集成到呜哩AI平台。文章还分析传统蒸馏方案问题并介绍团队改进策略。
一个月暴涨3K star,这是我见过最好用的AI生成PPT项目了!
职场人做PPT常耗在调格式等方面,现有AI工具多有缺陷。`dashi-ppt-skill`项目可生成网页版PPT编辑器,有多种主题、版式和控件,功能丰富,能本地完成操作,还介绍了安装和使用方法。
Sora 2 中国首测?Open AI 这次真成了!
OpenAI提前发布Sora 2模型,可克隆音色,支持多语言。还推出似AI版抖音的社交APP,免费生成视频。测试显示,它有世界知识,能多参生成、自动切镜头,在多方面表现出色,但版权限制严,部分一致性待提升。
CVPR2026满分论文:Proxy-GS为结构化3D高斯溅射引入统一遮挡先验
上海交通大学钟志航团队等在CVPR 2026提出Proxy - GS,面向基于MLP的结构化3D高斯溅射,用轻量级代理网格将遮挡关系变为可见性信号。在推理和训练阶段发挥作用,在遮挡密集场景实现渲染加速,画质与速度均优。
硬刚Sora2,万相2.6轻松定制角色、控制分镜,普通人也能当导演
2025 年视频生成领域发展迅猛,OpenAI 的 Sora 2 带来新玩法,商业落地加速,但普通用户体验门槛高。12 月 16 日阿里发布万相 2.6 系列模型,功能全面升级,实测效果惊人,标志 AI 视频生成迈向精准可控新阶段。
刚刚,Google Veo 3.1 发布,Sora 还香吗?
Google 发布 Veo 3.1,重新定义 AI 视频生成天花板。它对叙事深度理解,新增音频生成,有四大核心能力。网友将其与 Sora 2 对比,二者各有千秋。还介绍了 Veo 3.1 使用方式及 Flow 平台成果。