「生成一致性」共找到 2287 篇相关文章
这么哇塞的世界模型,竟然是开源的!
蚂蚁灵波开源通用世界模型LingBot-World,视觉效果与Genie 3不相上下且时间维度更长,能让用户深度参与,还具备一致性、记忆力等特点。它通过数据和模型层面创新炼成,结合此前开源成果构建具身智能基础设施。
CoT 之后,CoF 如何让帧间逻辑从「隐式对齐」变成「显式思考」?
CoT 虽提升语言模型推理能力,但在 C 端场景有局限,且被质疑并非真实推理。视觉领域提出 CoF 概念,Google DeepMind 团队引入理论,让视频模型通过帧链推理提升帧间一致性,还具强大泛化能力。
谷歌也要「AI抖音」了!新Veo 3.1原生支持竖屏,4K分辨率高画质
谷歌Veo 3.1升级,全方位提升视频生成质量,新增竖屏和4K两大特性。它还提升创意、一致性和元素融合能力。谷歌借此进军AI短视频,结合自身优势推动“AI视频竖屏化”趋势。
世界模型评测的最大盲区,被这个新基准捅破了
过去一年,‘世界模型’成视频生成领域热词,厂商强调产品要模拟真实世界运行规律,但业界评测一直未能精准检验其‘物体恒存’的认知能力。为此,研究者提出新基准MemoBench,测试了主流模型,揭示其短板。
AI+直播的新玩法! StreamDiffusionV2让创意零延迟
生成模型改变直播行业,但此前模型难保证时间一致性、有延迟等问题。加利福尼亚大学推出StreamDiffusionV2,通过智能调度和缓存机制优化,支持多GPU并行,可灵活调画质和延迟,实现实时直播。
抢先李飞飞!世界模型能多人联机玩FPS游戏了
Odyssey公司推出世界模型Agora - 1,驱动网页版多人FPS游戏,无游戏引擎等,画面实时生成。该公司专注通用世界模型,此前业务转向主动交互,此成果解决多人游戏一致性难题,还发布多模态模型Starchild - 1。
如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26
AI视频生成技术发展快,现有检测方法难满足需求。新综述提出‘事实保真度验证’目标,梳理四层检测框架,涵盖底层线索、时空一致性等,强调多层证据耦合与可解释性,还分析评测指标与数据集。
Seedream 4.0大战Nano Banana、GPT-4o?EdiVal-Agent 终结图像编辑评测
在AIGC下一阶段,图像编辑成检验多模态模型关键场景。研究者提出EdiVal - Agent评估框架,能自动化生成指令并多维度评估编辑结果,其评估与人类判断一致性高,还对比了13个模型的多轮编辑表现。
一分钟的奇迹与幻觉:实测世界模型Happy Oyster
4月16日阿里发布世界模型Happy Oyster,支持多模态输入与音视频联合生成。实测显示,它在场景构建、渲染上有优势,可替代部分传统引擎工作,但存在一致性不足问题,现阶段更适合改造游戏开发流程。
AI 时代的架构治理
本文指出在生成式AI时代,软件开发生命周期瓶颈转变为组织将创意转化为成果并保持架构凝聚力的能力。传统人工监督模式难应对,提出声明式架构策略,介绍其在事件模型、OpenAPI验证器等方面应用。