「三维场景生成」共找到 3827 篇相关文章
Sora 2干翻Veo 3?超全对比实测:会中文脱口秀,但体操翻车,附有效邀请码
OpenAI推出Sora2,可生成20秒1080p视频,在物理准确性等方面更优,还具备音画同步能力。文章对Sora2和谷歌Veo3进行多轮对比实测,涉及不同场景,也提及Sora2版权保护及App相关情况。
“不爱龙虾爱马仕”,为什么Hermes比OpenClaw更值得
文章对比了Hermes Agent和OpenClaw,Hermes由Nous Research出品,开源免费,安装便捷,支持多模型。其核心是闭环学习循环,能自我进化,技能可自动生成和更新,记忆系统更优,在多场景有优势,安全设计好。
Luma Uni-1.1 API开放,图像模型榜单第三,文字渲染直逼GPT image 2
今年图像生成模型迭代快,海外AI初创公司Luma将统一图像模型Uni - 1升级到1.1版并开放API。它在榜单排名前三,价格与延迟低,有诸多品牌客户接入。展示了多场景应用效果,技术路线独特,定价有优势。
设计师大解放!清华发布「建筑平面图」自动生成模型 | ACL'25
清华大学吕帅团队提出FloorPlan-LLaMa模型,采用自回归生成架构与RLHF机制,解决传统平面图自动生成模型‘指标优秀但实际不可用’痛点,提升生成式平面图设计质量与实用价值。该论文被ACL录用获领域主席奖。
终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成
过去两年视频生成模型不断提升画面参数,但传统模型生成的视频固定,用户无法干预。而世界模型可跟随操作实时渲染、动态生成世界。目前Noiz AI联合多机构发布实时可交互音视频世界模型HelixWorld 1.0,后续还将开源。
清华系DeepSeek时刻来了,硅谷沸腾!单卡200倍加速,视频进入秒级时代
清华大学TSAIL实验室与生数科技开源视频生成加速框架TurboDiffusion,引发全球AI社区热议。它能在几乎不影响生成质量的前提下,让视频生成速度飙升100 - 200倍,将AI视频带入实时生成时代。
Sora终于开放上传真人照片生成视频了
本周起,符合条件的Sora用户可上传含人物照片制作视频,使用前需声明获人物同意。这是Sora受期待功能之一,有严格限制,且照片转视频功能审查更严,此为OpenAI平衡之举。
英伟达新GPU,超长上下文/视频生成专用
在AI Infra Summit上,英伟达宣布推出NVIDIA Rubin CPX GPU,专为处理百万token级代码生成和生成式视频应用。它是首款为超大上下文AI量身定制的CUDA GPU,性能强且能效高,预计2026年底推出。
AI开始玩乐高了?我拼一小时的乐高,它几秒就搭好,LegoGPT开源了!
卡内基梅隆大学提出LegoGPT,是首个依文本提示生成物理稳定乐高积木模型的方法。构建了StableText2Lego数据集,训练自回归大模型生成设计,还开发纹理生成法,设计能手动或机器人组装。
Skills:从编程工具的配角到Agent研发的核心
文章探讨了Skills在AI Agent发展中的价值演变与适用场景,指出其价值具高度场景依赖性。在Claude Code编程工具中它表现平淡,在Agent研发中价值凸显,还给出使用场景判断维度与发展方向。