「4D视频生成」共找到 3942 篇相关文章
GPU-MODE Leaderboards之nvfp4_gemv代码阅读
文章围绕GPU-MODE的nvfp4_gemv竞赛rank1代码展开,先介绍问题及官方baseline,后详细解读rank1代码,含数据加载、线程模型等,还剖析核心计算函数,最后总结代码在缓存控制、数据格式等方面的调优亮点。
刚刚,OpenAI开放GPT-4.1,100万上下文、代码能力超强
今天凌晨1点30,OpenAI宣布开放GPT - 4.1,可在ChatGPT中使用。它针对编码任务,支持100万tokens上下文,在多项测试中表现优于前代,价格更优,不同用户将陆续获得使用权限。
Sora 关停背后:为啥它没跑成“视频版 ChatGPT”?
OpenAI Sora 宣布关停,其评论区评价两极分化。它没跑成“视频版 ChatGPT”,问题在于使用频率、成本结构和产品形态。关停或与 OpenAI 筹备 IPO 有关,未来 Sora 团队将推进相关研究。
简单快速的用 Claude Code 帮你创建 PPT 生成 Skills
Claude Code热度高,其Skills可辅助构建简单Agent。作者以创建Nano Banana PPT生成Skills为例,教大家安装、使用及创建Skills,还提及Skills迭代和局限性等内容。
Lumina-DiMOO:多模态扩散语言模型重塑图像生成与理解
上海人工智能实验室推出多模态扩散语言模型 Lumina - DiMOO,它基于离散扩散建模,打破多模态任务壁垒。相比传统自回归架构模型,它解决了生成慢、质量受限等问题,在多项评测中夺魁。
The Batch:924|GPT-5.4:性能更高,价格也更高
OpenAI更新旗舰模型GPT-5.4,有Thinking和Pro两个版本,扩展工具使用能力,多基准测试达当前先进水平,但定价高。虽在部分任务表现超Claude,挑战Gemini地位,不过成本也更高。
免剪辑直出!AI生成多角色同框对话视频,动态路由精准绑定音频
Bind-Your-Avatar基于扩散Transformer框架,通过细粒度嵌入路由将语音与角色绑定,实现精准音画同步,还引入数据集MTCC和基准测试,实验显示其在身份保真和音画同步上优于现有方法。
合成数据≠生成模型:一文读懂合成数据的全新范式
最新研究提出合成数据全新分类框架,突破‘生成模型=合成数据’传统认知,涵盖多种方法。还按应用层次划分场景,指出合成数据面临模型坍塌等挑战,正成新型基础设施。
效果非常不错!阿里昨开源图形海报生成模型Qwen-Image
阿里昨日开源多模态图像基础模型Qwen-Image,基于20B参数MMDiT架构,在复杂文本渲染和精确图像编辑方面有重大突破,支持多风格图像生成、智能图像编辑等,还介绍了使用、部署等方法。
谷歌 Java 代理开发工具包新增 LangChain4j 集成
谷歌 Java 代理开发工具包(ADK)0.2.0 版本集成了 LangChain4j,显著扩展功能,让开发者能使用更多模型。谷歌开发者 Guillaume Laforge 解释其优势,ADK 还引入系列增强提升性能。