「生成式人工智能」共找到 2976 篇相关文章
首次实现第一视角视频与人体动作同步生成!新框架攻克视角-动作对齐两大技术壁垒
新加坡国立大学等联合发布EgoTwin,首次实现第一视角视频与人体动作联合生成,攻克视角 - 动作对齐与因果耦合瓶颈。它基于扩散模型,通过三大创新设计解决核心难题,实验性能超基线,为多领域应用提供落地基座。
何恺明带大二本科生颠覆扩散图像生成:扔掉多步采样和潜空间,一步像素直出
何恺明团队提出新方法Pixel Mean Flow(pMF),突破传统扩散模型/流模型限制,砍掉多步采样和潜空间,一步在像素空间生成图像,在ImageNet不同分辨率上取得佳成绩,还介绍了核心设计、实验结果对比等。
让AI作画自己纠错!随机丢模块就能提升生成质量,告别塑料感废片
来自清华、阿里等的团队推出S² - Guidance方法,通过随机丢弃网络模块动态构建子网络实现自我修正。它避免了其他方法繁琐调参,在文生图和文生视频任务中显著提升生成质量与连贯性,且计算高效。
微软炸场了!一张图片仅需3即可生成带完整PBR材质的超高质量3D资产!
微软推出3D资产生成大模型TRELLIS,能接收文本或图像提示,输出高质量3D资产。其结果质量强,支持灵活切换输出格式和局部3D编辑,还给出安装和使用方法及项目地址。
开源播客TTS神器!高效TTS模型:Muyan-TTS,0.33秒生成1秒音频,零样本语音合成!
介绍新发布的开源TTS模型Muyan - TTS,它专为播客场景设计,以超低延迟实现零样本语音合成,预训练大量播客数据,支持长内容连贯生成,还介绍了使用步骤、适用场景等。
阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题,登HuggingFace热榜
阿里开源长文本深度思考模型QwenLong - L1,登上HuggingFace热门论文第二。它解决了长文本强化学习训练难题,通过渐进式上下文扩展训练,在多基准测试中表现出色,还探讨了SFT和RL作用。
“导演梦”不再遥远:Captain Cinema 让你用短片制作出电影
约翰·霍普金斯大学与字节Seed团队推出自动生成短片的Captain Cinema系统。它以剧情文字为输入,先规划关键帧,再补全画面动态合成短片。采用特殊训练法和模型,虽有局限,但为电影自动生成迈关键一步。
任意骨骼系统的模型都能驱动?AnimaX提出基于世界模型的3D动画生成新范式
传统3D动画制作依赖骨骼绑定与关键帧编辑,成本高。现有自动化方法有局限。北京航空航天大学团队提出AnimaX框架,结合视频扩散模型与骨骼动画优势,支持任意骨骼拓扑,生成动画质量高、速度快,泛化能力强。
谷歌Veo 3魔性切水果刷屏全网!逼真视频狂吸10万粉,全体网友颅内高潮
谷歌AI视频工具Veo 3生成的解压切水果视频在全网病毒式传播,TikTok号主粉丝量猛涨。今天凌晨谷歌官宣其正式上线,网友热情高涨。此外,它还能实现多种创意视频生成,一位制作人用它两天做出3000万播放量广告。
创业一年后,李飞飞推出首款可商用世界模型 Marble,任意模态都可生成 3D 世界
李飞飞创业公司 World Labs 推出可商用世界模型 Marble,支持多模态输入,生成的 3D 世界更丰富细致。李飞飞认为空间智能是 AI 下一个前沿,当前 AI 在这方面能力不足,而 Marble 正推动其发展。