「世界生成」共找到 2920 篇相关文章
李飞飞首个多模态世界模型 Atlas 正式发布:从零开始预训练,几张图就能构建世界
李飞飞创办的 World Labs 发布多模态世界模型 Atlas,可原生处理多类型数据,有世界生成、重建和模拟等能力。还介绍其研发历程、技术特点,以及 World Labs 收购、融资等情况。
每一幕皆可控!字节发布多主体视频生成神器,人人皆主角
字节发布多主体视频生成神器MAGREF,基于一张参考图像,能生成主体高度一致的视频,多人同台也不串脸。它采用三阶段数据处理流程,构建在DiT架构上,实现复杂视频生成任务。
再封神!OpenAI掀翻AI图像生成,极度逼真,立刻商用
网传OpenAI的GPT-image-2正在灰度测试,韩国网友测试后称其生成图像可‘立刻商用’。它深度融合GPT大语言模型,生成照片更逼真,强化了提示遵循和场景理解能力,让AI图像生成进入‘实用时代’。
震撼,世界模型第一次超真实地模拟了真实世界:谷歌Genie 3昨晚抢了OpenAI风头
昨晚谷歌DeepMind宣布Genie世界模型到第3代,能通过单个文本提示词创建交互式、可玩环境。它在多方面优于前代及其他模型,具备构建完整世界能力,但也存在动作空间有限等局限,未来应用值得期待。
世界模型来了因果技术标杆!具身大脑真要长脑子了
具身智能有泛化能力瓶颈,构建‘世界模型’成热门赛道。Aether AI获2000万美元种子轮融资,走因果世界模型路线,创始人黄碧薇认为这是世界模型‘终局形态’,能让机器人理解物理规律。
NextStep-1:一次在图像生成上自回归范式的探索
阶跃星辰团队探索自回归图像生成新路径,推出 NextStep-1。它直接在连续视觉空间自回归生成,架构简洁,实现端到端训练。模型有高保真生成和编辑能力,Benchmark 表现佳,但也面临稳定性等挑战。
DreamArt!只需一张图,生成可动的可交互物体
生成可动物体是具身智能等领域关键挑战,现有方法有局限。北大团队提出DreamArt框架,从单张图像生成可交互可动物体,经三阶段流程,表现优于基线方法,不过也存在生成不符物理规律等问题。
AI生成操作系统新突破!上海交大提出文件系统开发新范式:从此只需写规约
上海交大IPADS实验室团队在自动生成操作系统核心组件上有新突破。面对大模型生成操作系统的难题,提出SysSpec新范式,以规约指导生成,并配套工具链,构建SpecFS文件系统,开发效率提升3 - 5倍。
AI生成内容新标准来了!现公开征集起草单位和专家!
随着AIGC转向产业落地,监管对生成内容管控成趋势。全国首个AI生成内容合规团体标准《人工智能生成内容合规管理指南》应运而生,还公开征集起草单位和专家,助力企业解决合规难题。
32倍加速,58秒搞定720p视频!字节发布离散自回归框架,统一视觉生成和长视频生成
字节发布InfinityStar框架,将5秒720p视频生成时间从30多分钟缩至58秒,还支持多样任务。它基于对视频本质思考设计时空金字塔模型,将时空分离,通过多项技术优化,性能表现出色,不过也存在一些技术局限。