「多模态视频生成」共找到 3291 篇相关文章
不是,微信视频号里现在也能召唤腾讯元宝了?。。。
现在可在视频号评论区用@召唤腾讯元宝。测试发现,它能总结视频内容、提取金句、总结脚本,还能总结菜谱。添加好友后就能使用,未来评论区或成共创聚集地。
何恺明CVPR最新讲座PPT上线:走向端到端生成建模
今年CVPR闭幕,何恺明现身会场并做了主题为‘走向端到端生成建模’的分享,近日其个人网页上传了该分享PPT。PPT回顾识别模型演进,探讨生成模型能否重演历史,还介绍了MeanFlow方法及成果。
开源版Suno来了:本地跑AI音乐生成,免费、无限、完全属于你
ACE - Step UI开源项目改变AI音乐生成现状,提供本地方案。它是完整音乐工作站,虽生成质量与Suno有差距,但在费用、隐私等方面优势明显,预示AI音乐生成开源生态崛起。
DeepSeek多模态真的来了?识图模式已开始小范围灰度
4月29日,DeepSeek多模态团队负责人陈小康在X发布动态暗示多模态进展。部分用户在DeepSeek官方App灰度到“识图模式”,这是其主线产品首次有图像理解能力模式,此前多模态人才有流失,官方未说明开放细节。
ICCV 2025 | 港科、牛津大学发布AlignGuard,文图生成模型可规模化安全对齐框架
随着文图生成模型广泛应用,其安全防护机制有限。ICCV 2025上,港科、牛津大学推出AlignGuard,是文图生成模型可规模化安全对齐框架,通过生成CoProV2数据集等实现安全对齐,实验效果佳。
刚刚,商汤内部两万字复盘曝光:多模态通往AGI核心路线首次公开
商汤科技联合创始人林达华撰写万字长文,剖析将「多模态通用智能」视为技术战略核心引擎的原因,探索组织及战略层面的思考。文章回顾商汤多模态之路,探讨多模态通向AGI的原因、构建路径等关键问题。
参编邀请 | 全国首部“AI生成内容合规”标准公开征集中,欢迎加入!
2026年8月2日欧盟《人工智能法案》透明度条款执法,全球AI生成内容合规监管进入硬约束时代。中国首个AI生成内容合规团体标准《人工智能生成内容合规管理指南》公开征集参编,亮点多、价值大。
破解空间智能数据稀缺难题,影石开源DiT架构全景生成模型,在线可玩
影石研究院团队推出基于DiT架构的全景图像生成模型DiT360,设计分层混合训练框架,结合透视与全景图像数据,提升真实感和几何一致性。它支持多任务,优于现有方法,为三维场景生成提供新思路。
苹果提出原生多模态Scaling Law!早融合+MoE,性能飙升秘密武器
如今打造强大多模态模型是AI重要目标,常用方法有局限。法国索邦大学、苹果研究人员开展原生多模态Scaling Laws研究,对比早融合与后融合,探讨多种因素对模型性能影响,发现早融合、多模态MoE优势,为后续研究指明方向。
不要再拖拉拽了,利用n8n mcp直接生成n8n工作流
n8n是国外热门的AI应用编排工具,但用好它生成工作流并不容易。现介绍能生成n8n工作流的mcp,简单配置即可让AI生成工作流,其地址为https://github.com/czlonkowski/n8n - mcp。