「图像到有声视频」共找到 1340 篇相关文章
手撕Sora,脚踢Veo!13个行业实战案例,Seedance 2.0玩法大全
本文是藏师傅对 Seedance 2.0 的测评和教学,介绍其 API 春节后将上线火山引擎,支持全模态输入。通过 13 个行业实战案例展示该模型能力,如生成广告、宣传片、教学视频等,还提及 Agent 自动化应用。
刚刚,智谱开源了他们的最强多模态模型,GLM-4.5v。
智谱接连开源GLM - 4.5和GLM - 4.5V,后者为多模态模型,总参数106B,在42个评测基准中41个达到SOTA。经测试,它视觉推理强、速度快,还有视频理解等功能,API定价良心,体现持续开放精神。
8B硬刚72B!MiniCPM-V 4.5技术报告正式出炉
行业首个具备“高刷”视频理解能力的多模态模型MiniCPM-V 4.5技术报告发布,提出三项关键技术,使模型在多任务达同级SOTA,8B参数规模超72B模型,推理快,开源后获社区好评。
OpenAI突然发布Sora 2:好一个“AI版抖音”!
OpenAI重磅上新,带来依托Sora 2的“AI版抖音”——Sora iOS APP。Sora 2是音视频同步生成模型,更遵循物理定律、可控性强,还能注入现实元素。实测效果佳但画质低,Pro版可改善,后续还会发布API。
iPhone 17 Pro居然能跑8B大模型!
iPhone 17 Pro竟能跑8B大模型,如Qwen3 - 8B,推理较流畅。作者换机一是因eSIM,二为拍视频。其认为AI普及需端侧落地,此机芯片性能是好信号,盼出优质iOS客户端。
谢赛宁也玩MC?开源全新世界模型生成多人一致的游戏视角
电子游戏推动AI发展,谢赛宁团队探索世界模型新方向,推出多人视频世界模型Solaris。该模型能生成多人一致的第一视角,团队还搭建了多人数据采集系统SolarisEngine,构建了多人Minecraft数据集。实验结果显示,其方法在多方面表现更优。
NTU S-Lab 团队探索可动 3D 新方向:结构、关节、纹理一次到位
南洋理工大学 S-Lab 团队发布研究,提出统一建模框架,能从单张图像生成可动三维对象,在几何精度、外观一致性与运动合理性上显著提升,解决了现有方法的难题,为相关领域发展奠定基础。
全网挤爆Seedance 2.5,但2.0 fast降到6毛是真的香!
近期AI视频赛道竞争激烈,FLUX 3登场,国内巨头也纷纷推出新模型。字节Seedance 2.5优势明显,但适用特定场景。Seedance 2.0 fast降至6毛每秒,经多场景实测,表现均衡,是性价比之选。
The Batch: 839 | 好莱坞加入 AI 版权之争
好莱坞电影公司加入对用其版权作品训练AI模型公司的抗争。迪士尼和环球起诉Midjourney,指控其未经授权用版权作品训练模型、分发含其角色图像,请求停侵权并索赔,版权法相关界定尚不明确。
老黄挤爆牙膏!DLSS 4.5狂飙6倍,RTX 50系直接封神
2026年CES大会上,英伟达发布DLSS 4.5提升画质与帧生成,RTX Remix助力经典游戏重生,还将NPC变智能伙伴。同时,其软件升级利好AI PC,提升性能、减少显存消耗,让它更接近日常使用。