「多模态创作」共找到 1238 篇相关文章
快手可灵也吃上了香蕉,一通离谱prompt测试,好好玩要爆了
ChatGPT发布三周年,快手可灵AI视频「O1模型」登场,号称“全球首个统一多模态视频模型”。实测显示它能一站式搞定视频修改、镜头延展等操作,还推出了图片O1模型,在图片生成方面表现出色。
原神LOL齐聚的Unity开发者大会,我看到了AI游戏的未来
2025 Unity开发者大会展示了“AI+游戏”的新趋势。Unity团结引擎推出AIGC工作流平台AI Graph,降低开发门槛;AWS用AI赋能游戏全生命周期;Meshy专注3D GenAI。但玩家对AI创作有抵触,需建立信任机制。
Rex-Omni:用 3B 模型颠覆目标检测
长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态大模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。
碾压小扎!22岁成亿万富翁,2025年AI造富速度刷新人类认知
2025年AI成超级造富机,将50多位创始人送入亿万富翁俱乐部。从大模型到应用层,AI渗透生活。巨额融资不断,巨头砸钱建基建,人才争夺激烈,多模态初创公司也受青睐,职场AI使用比例上升。
超越谷歌Banana,字节联合香港中文大学等高校开源最强图像编辑生成系统DreamOmni2
香港多高校与字节跳动联合研发的DreamOmni2系统,实现图像编辑与生成领域SOTA。它用三步造出高质量数据,提出索引编码等方案,联合训练模型,实际效果超越部分商业模型,为AI创作带来新可能。
AI 会取代人类思考吗?我们为什么仍要亲手写作和编程
文章探讨AI是否会取代人类思考,指出不能过度依赖AI,如写作和编程应亲力亲为。还给出使用AI的指南,引用多方观点说明人类在创作、决策等方面的价值,以及学习编程和掌控AI的重要性。
南洋理工 | 推出开源版MetaQuery:OpenUni,1.1B参数媲美BLIP3-o-8B
南洋理工大学 S-Lab 和商汤科技团队推出开源版 MetaQuery——OpenUni,仅 1.1B 参数就达 8B 模型性能。它架构极简、参数高效且完全开源,还采用两阶段训练策略,虽有局限但为多模态模型研究助力。
50个Agent分工干活,Kimi K2.5的Agent“军团”把我看呆了。。。
Kimi K2.5今日下午发布并开源,具备多模态能力。它能根据视频、链接等复刻网站,有Visual Edit功能且自动部署上线。还有Agent Swarm场景,多Agent协作解决复杂问题,应用体验佳。
看完最新国产AI写的公众号文章,我慌了!
AI 快砸作者饭碗,智谱 GLM - 4.6V 能根据 NeurIPS 2025 最佳论文生成图文并茂的公众号文章。它还能助力学生看论文、分析财报等,可复刻网站、处理视频,在多模态评测中达同级别 SOTA。
视频生成Prompt何须仅是文字!字节&港中文发布Video-As-Prompt
AI视频生成中,依赖抽象语义控制的创作因缺乏统一条件表征而困难。字节与港中文团队提出Video - As - Prompt框架,引入‘视频参考’范式,实现抽象语义下可控视频生成范式统一,代码和数据集已开源。