「3D场景编辑」共找到 3799 篇相关文章
视频生成不再「断片」:OneStory给模型装上「选择性记忆」,跨镜头讲故事人物场景始终如一丨CVPR'26
多镜头视频生成挑战大,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,为多镜头视频生成建立跨镜头记忆机制,可生成连贯长视频,在复杂叙事中保持一致。
刚开源就斩获 3.8K Star!MiniMax 官方把压箱底的硬核技能包开源了!
MiniMax 官方开源 Skills 仓库,这是一套为 AI 编码助手设计的开发技能包。涵盖前端、全栈、Android、iOS、图形开发及办公等多领域,按流程走可让 AI 代码质量对标大厂资深工程师,安装也简单。
0行人类代码!OpenAI内部绝密实验曝光:3人团队5个月砸出百万行级产品
OpenAI工程团队进行内部实验,构建并发布零人类代码的内部软件产品,代码全由Codex智能体编写。团队分享开发经验,如重新定义工程师角色、让应用对智能体可见等,还面临一些未知挑战。
3天5k+星标,港大开源极致轻量OpenClaw, 1%代码量打造个人专属贾维斯
硅谷被 Agent(OpenClaw/ClawdBot)刷屏,但 40 万 + 行代码让开发者望而却步。港大黄超老师课题组将其重构为 4000 行的 nanobot,保留功能且降低门槛,上线三天获 5000+ 星标。
全景视觉的Depth Anything来了!Insta360推出DAP,200万数据打造全场景360°空间智能新高度
Insta360等团队推出全景度量深度基础模型DAP,构建200万量级全景数据引擎,设计三阶段伪标签管线,在模型架构上也有创新,在多项测试中效果优异,项目代码与模型已开源。
通向L3的正确范式?理想i8全球首发VLA高阶辅助驾驶,我们帮你试了试
本周二,理想全新纯电SUV理想i8上市,其搭载的VLA辅助驾驶系统受关注。理想发现端到端数据驱动升级有局限,VLA架构改进让系统有思维、沟通等能力,还带来平顺性等提升,且研发各方面能力强。
开源版MetaQuery来了!OpenUni用1.1B参数媲美BLIP3-o-8B,数据代码完全开源
南洋理工大学 S-Lab 和商汤科技团队推出开源版 MetaQuery——OpenUni,仅 1.1B 参数达 8B 模型性能,代码、权重、数据全开源。它架构极简、参数高效,还继承了多模态理解能力。
狂涨10.3K star!最近爆火的微信记录训练专属数字分身,支持语音克隆,绝了!
在AI大模型时代,大家想让模型更个性化。最近GitHub爆火的开源项目`WeClone`,用微信聊天记录训练专属AI打造数字分身,还能语音克隆。它全链路覆盖、支持多模型,有隐私保护等特色,操作也有介绍。
让大模型基于「图像事实」说话:用事实文本+自适应编辑,让语言偏见无处遁形丨ICLR'26
多模态大模型看图常“脑补”,存在对象幻觉问题。北航团队提出AFTER框架,含FAS和QAO模块,能在主流LVLM和基准上显著降低幻觉,且推理开销低,为多模态助手落地提供实用路径。
李飞飞50亿美金赛道被开源!浙大教授章国锋带队创业,打造无限时长实时3D世界模型
2024年李飞飞创立的World Labs入局空间智能赛道,估值达50亿美元。近日影溯发布并开源实时帧生成模型InSpatio - WorldFM,由章国锋领衔,该模型突破2D局限,效率高、能无限时长推理,展现出高工程可用性。