「三维场景生成」共找到 3827 篇相关文章
第一个用物理做计算原语的大规模生成模型Un-0来了,或将AI能耗降低1000倍?
Unconventional AI 发布首个以物理为计算原语的大规模生成模型 Un-0,由‘模拟耦合振子系统’驱动。其目标是降低 AI 能耗,在 ImageNet 64×64 上 FID 达 6.74,质量接近部分主流传统图像生成方法刚发布时水平。
至简动力交付百台「开箱即用」机器人,加速具身量产节奏
2026年7月6日,至简动力宣布完成首批百台i7 Pro机器人交付,落成CNC智能化产线。其产品定位‘开箱即用’,适配多场景。但行业仍处早期,至简面临跨场景成本、数据飞轮、产能等问题待解。
腾讯发布Hunyuan-GameCraft!从静图进入动态游戏世界
近年来,现有方法难满足游戏视频生成需求。腾讯推出Hunyuan - GameCraft,可基于一张图像和提示词生成游戏交互视频,能精准响应交互信号,保留历史场景信息,不过动作空间待丰富。
AI Native 的影像公司们,颠覆赛道的机会来了!
文章指出过去50年影像公司通过推动坐标点向「计算」端移动创造商业变量。如今计算突破天花板,带来理解、增强、生成现实三层价值释放,解锁新场景,AI Native影像公司机会巨大。
视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒
谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出图快且便宜。二者串联使用,图像生成与视频创作可无缝衔接。
真可用!美团数字人模型开源,MV、电商等统统拿下
美团开源数字人视频生成框架 LongCat - Video - Avatar 1.5 版本,换音频编码器、加速推理,支持多任务与多场景。经770人评测,它在多维度领先对手,各方面表现均衡,效率与质量兼得。
开源 VibeSDK:把一句话变成线上应用,用它一键搭好自己的 AI平台
Cloudflare VibeSDK 是开源 AI vibe coding 平台,跑在 Cloudflare 开发者生态上,支持自然语言生成全栈 Web 应用,有分阶段代码生成、交互式聊天等功能,适用于多类人群和场景,还对比了同类项目。
4 天 6.8K Star,这个 AI 漫剧项目火了:waoowaoo!
短剧/漫剧市场火爆,但普通人制作门槛高。waoowaoo是solo开发者作品,4天6.8K Star。它能从小说文本一键生成视频,涵盖AI剧本分析、角色场景生成等功能,部署简单,技术栈主流。
GitHub热搜,腾讯黑科技炸场!PhotoMaker:10秒定制真人级头像,百万开发者已疯狂
PhotoMaker是腾讯ARC实验室联合南开大学发布的人像图像生成项目,荣膺CVPR 2024。它能秒级生成高质量人像,有高保真ID嵌入等机制,V2版升级显著,适用多场景,比同类项目优势明显。
任意条件,「可控」文生图扩散模型综述 | TPAMI'25
北京邮电大学团队在顶级期刊IEEE TPAMI发布综述,探讨文生图扩散模型可控生成技术,将核心问题概括为如何注入新型条件信号并稳定控制,从任务和方法层面梳理技术,还提及应用场景与未来方向。