「视觉-语言生成」共找到 3485 篇相关文章
给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策
上海交通大学和小红书团队推出面向通用视觉 Agent 的多模态技能框架 MMSkills,将可复用技能扩展为多模态程序性知识,通过 branch loading 调用视觉证据,在 GUI 与游戏任务评测中表现出色。
一个全新的世界模型,终于让AI视频进入了“无限流”时代。
AI视频公司PixVerse推出实时世界生成模型PixVerse R1,用户可输入Prompt修改视频进程,无干涉时视频会自行延续。该模型为世界模型补上实时视频生成方向,实测体验乐趣十足。
4 天 6.8K Star,这个 AI 漫剧项目火了:waoowaoo!
短剧/漫剧市场火爆,但普通人制作门槛高。waoowaoo是solo开发者作品,4天6.8K Star。它能从小说文本一键生成视频,涵盖AI剧本分析、角色场景生成等功能,部署简单,技术栈主流。
告别AI「鬼画符」!一行指令「复活」王羲之、苏轼,带连笔、懂排版,项目已开源丨ICLR'26
UniCalli由香港科技大学(广州)等团队推出,是全新统一扩散框架,能精准生成书法排版和连笔,将书法生成和古籍识别统一,工作被ICLR2026接收,代码、数据集开源,还有在线Demo。
"Slop"当选年度词汇:AI垃圾内容有了正式名分
韦氏词典宣布“slop”当选2025年度词汇,指AI生成的低质量数字内容。过去一年它频繁用于形容AI内容,如今AI生成网络文章占比超50%,还催生“slop经济”,但AI内容或优胜劣汰。
一夜颠覆Sora神话,H200单卡5秒出片!全华人团队开源AI引爆视频圈
UCSD等机构发布FastWan系模型,用「稀疏蒸馏」训练方案,让视频去噪速度飙升70倍。FastWan在单张H200上5秒生成480p视频,模型权重等全开源,改写AI视频生成格局。
小扎又开源了:7B实现自监督学习SOTA
Meta发布全新开源视觉模型DINOv3,首次证明自监督学习模型能在广泛任务中超越弱监督学习模型。它用无标注方法,扩展数据和模型规模,支持标注稀缺场景,在多任务实现SOTA。
视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒
谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出图快且便宜。二者串联使用,图像生成与视频创作可无缝衔接。
更快更省!Vidu Q3硬核升级打响AI视频普惠第一枪 | 甲子光年
2026年AI视频行业内容产出增长迅猛,但成本上涨、生成慢等问题凸显。生数科技的Vidu Q3模型全面升级,生成速度提升5倍、价格降低,适配多场景,为AI视频普惠工业化提供范例。
Nano Banana Pro或将引爆新安全危机
基于Gemini 3的图像生成模型Nano Banana Pro昨日上线,支持2K/4K分辨率生成,排版和文字控制能力提升。它展现出复杂推理能力,能理解反光、推理指纹,但这或带来隐私危机。