「4D生成」共找到 3693 篇相关文章
VinciCoder:多模态统一代码生成框架和视觉反馈强化学习,数据代码模型权重已开源
中科院与美团团队推出 VinciCoder,打破多模态代码生成中 SFT 范式瓶颈。它将奖励机制转向视觉域,通过两阶段策略统一多样化代码生成任务,在多基准测试中表现卓越,为领域研究提供新范式。
大道至简,何恺明团队新作pMF开启像素级「无潜、单步」生成范式
何恺明团队新论文提出用于单步、无潜空间图像生成的pMF框架,直指主流扩散与流匹配模型通病。该框架将v、u和x三个场关联,训练网络把噪声输入直接映射为图像像素,实验表现强劲。
GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”
智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。
AI 如何讲好一个多人故事?首个支持多角色互动的3D场景叙事系统
首尔国立大学提出全新框架,能生成虚拟动态场景并支持多角色上下文动作生成。引入LLM拆解复杂任务,系统用事件驱动方式规划动作,还构建基准评估相关能力,有良好扩展性和实用性。
阿里AI 重磅第4发:电影级MOE 视频模型Wan2.2正式开源!
阿里通义团队开源电影级视频生成模型Wan2.2,将光影、色彩、镜头语言装进模型,支持60多参数自由组合。它是业界首个用MoE架构的视频生成模型,推理省计算资源,性能超主流模型,获国外网友盛赞。
Grok 4作战图刷爆全网,80%华人横扫硅谷!清华上交校友领衔,95后站C位
Grok 4一夜爆火硅谷,一张内部作战图显示其幕后团队华人学者占比达80%,包括Jimmy Ba、吴怀宇等。独立评测中Grok 4成绩优异,但也有人质疑其代码基准结果有过拟合嫌疑。
VAE再被补刀!清华快手SVG扩散模型亮相,训练提效6200%,生成提速3500%
前脚谢赛宁宣告VAE在图像生成领域退役,后脚清华与快手可灵团队就推出无VAE潜在扩散模型SVG。它通过语义+细节双分支+分布对齐,实现多任务通用,训练提效62倍、生成提速35倍。
开源 AI 文档生成器!给代码库做个CT扫描,一键生成交互式Wiki文档!
介绍开源工具DeepWiki-Open,它由AsyncFuncAI开发,能将GitHub或GitLab仓库一键转为交互式Wiki,基于多种技术实现代码分析和自动化文档生成,解决开发者理解复杂代码库的痛点,还给出快速上手步骤和适用人群等。
原生理解生成统一:商汤开源SenseNova U1,用统一架构终结「缝合怪」多模态
商汤开源日日新 SenseNova U1 系列原生理解生成统一模型,采用 NEO-unify 架构,只需 8B 小参数就能实现很多商业闭源模型效果。在多测评维度性能领先,还能实现连续性图文创作输出,解决理解与生成断层问题。
还在为拍视频头疼?AI 一键生成短视频,这工具也太香了吧!
文章介绍开源工具 Pixelle-Video,它能让视频创作变得简单。输入主题,它可自动撰写文案、生成配图、合成语音、添加音乐并合成视频,还支持多种功能和大模型,有多种使用和付费方案。