「空间生成模型」共找到 8869 篇相关文章
SGLang|SGLang Diffusion
来自SGLang开源社区的Yichi介绍SGLang Diffusion,它是面向图像与视频生成的全开源扩散模型推理引擎。基于SGLang机制将能力迁移到扩散模型推理,能显著提速工作流,视频展示了多种功能。
抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT-4o
抖音SAIL团队与LV - NUS Lab联合推出多模态大模型SAIL - VL2,以中小参数规模在106个数据集实现性能突破。该模型从架构、数据、训练三方面创新,后经全链路优化,在多数据集验证中表现卓越。
GPT-6要「活」了?MIT新作曝光,AI「自进化」不远了
麻省理工学院推出全新自适应大模型框架「SEAL」,让模型从「被动学习者」变为「主动进化者」。网友猜测GPT - 6可能整合其能力,成为能自主学习的模型,研究虽有局限,但为大模型自进化提供新路径。
NeurIPS 2025 Spotlight | 你刷到的视频是真的么?用物理规律拆穿Sora谎言
随着生成式AI发展,合成视频以假乱真,现有检测方法难泛化。本文介绍发表于NeurIPS 2025的文章,提出NSG统计量和NSG - VD检测方法,对未知生成范式检测效果好,实验表现超越现有方法。
CVPR 2026 | 让AI视频不再「串戏」:免训练精准控制多段动作,SwitchCraft一招破解逻辑崩坏
随着文本到视频扩散模型发展,AI视频生成有进展,但开源模型处理多事件提示词时存在技术瓶颈。西湖大学团队提出免训练框架SwitchCraft,引入注意力控制机制,入选CVPR 2026,代码已开源。
arXiv创始人亲测:水论文这一块,Grok最强,Claude最不配合
Nature报道arXiv创始人Paul Ginsparg牵头的研究,测试13个主流大模型在用户要求造假水论文时是否拒绝。结果Claude最守底线,Grok和ChatGPT较易“配合”,多轮对话中模型易动摇,论文激增危害多。
The Batch: 868 | AI 视频走向主流
生成式视频席卷网络爆款、广告宣传,甚至登陆 Netflix 剧集。如 Dor Brothers 用 AI 打造爆款视频,Genre.ai 低成本制作广告。各主体制作方式有别,顶尖模型开发商也积极与影视方合作,AI 正改变影视业。
苹果出手!改进GRPO,让dLLM也能高效强化学习
苹果研究团队针对扩散语言模型(dLLM)在编码任务中表现不明的问题,基于7B级代码生成MDM DiffuCoder展开研究,定制优化GRPO提出coupled - GRPO算法,填补开源dLLM训练和推理机制空白。
开源 VibeSDK:把一句话变成线上应用,用它一键搭好自己的 AI平台
Cloudflare VibeSDK 是开源 AI vibe coding 平台,跑在 Cloudflare 开发者生态上,支持自然语言生成全栈 Web 应用,有分阶段代码生成、交互式聊天等功能,适用于多类人群和场景,还对比了同类项目。
字节 AI 卷出新高度:豆包试水“上下文定价”,Trae 覆盖内部80%工程师,战略瞄定三主线
近日字节分享 AI 技术发展三主线,6 月 11 日火山引擎有系列发布更新。豆包 1.6 实行上下文定价,成本降低;超 80% 字节工程师用 Trae;视频生成模型 Seedance 1.0 Pro 具性价比;智能体带动强化学习算力攀升。