「视觉生成模型」共找到 8924 篇相关文章
拳打可灵,脚踢 Veo 3,谁是物理世界的「懂王」?
多模态视频生成大模型是复杂系统工程,多为巨头游戏。MiniMax的Hailuo 02发布,ELO得分超谷歌Veo 3和快手Kling 2.0。它能呈现复杂运动,处理物理关系,提升训练推理效率,成本低,后续还将更新。
TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法
北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。
实测可灵O1,AI视频界的Banana也来了。
可灵推出全新多模态视频大模型可灵O1,融合多种视频生成与修改能力。实测显示,它能实现视频内容增删、特定内容修改、扣绿幕、动作迁移、风格更改等功能,虽有局限,但开启用嘴改视频新时代。
Nano banana手办玩法火爆出圈!无需抽卡,效果惊了(°o°)
小某书被AI手办图刷屏,原来是谷歌的nano - banana(Gemini 2.5 Flash Image)模型爆火。文章实测其手办玩法,还介绍多种玩法,团队透露以文本渲染评估、原生多模态等核心技术,谷歌未来想整合模态实现AGI,还将举办黑客松。
实测腾讯首个 AI IDE 产品,小白也能『批量开发』微信小程序
2025年AI Coding领域竞争激烈,腾讯7月22日揭幕国内首款“产—设—研”全链路AI IDE CodeBuddy。它支持主流模型,能将想法转化提示词等,通过多个案例展示其强大功能,腾讯还计划让其普惠开发者。
Sora 2刷屏全网:拍《瑞克和莫蒂》、过物理测试,太棒了
OpenAI推出的Sora 2刷屏海外,能完成以往视频生成模型极难实现的任务,在物理准确性、逼真度和可控性上有重大提升。它还能进行二创、模拟电脑操作等。OpenAI发布由Sora 2驱动的社交APP,强调促进创作,保障安全。
刚刚,GPT-5.2满分屠榜,OpenAI十周年王者归来
OpenAI 十周年推出 GPT - 5.2 系列模型,包括 Instant、Thinking 和 Pro 版本。它在多方面表现出色,刷新多项基准测试 SOTA 水平,如 AIME 2025 获满分,在 GDPval 达人类专家水平。还在编码、视觉理解等能力上有显著提升。
当智能醒于物理世界,英伟达副总裁: 下一个十年属于物理AI!|新智元十周年峰会
在新智元十年峰会上,NVIDIA副总裁赖俊杰揭示公司下一个十年战略核心——物理AI,它是继生成式AI和智能体AI后的下一波浪潮。物理AI与现实物理世界交互,但面临诸多挑战,英伟达为此开源Cosmos世界基础模型。
NVIDIA技术沙龙《强化学习流水线优化:性能分析与 Rollout加速》演讲笔记
该演讲笔记围绕强化学习流水线优化,强调用Nsight Systems做性能分析,介绍在Ray Actor添加参数及解读文件方法。给出训练/生成参数优化技巧,如Actor训练和Rollout优化,还以Qwen 2.5 7B等模型为例总结参数调优经验。
“不爱龙虾爱马仕”,为什么Hermes比OpenClaw更值得
文章对比了Hermes Agent和OpenClaw,Hermes由Nous Research出品,开源免费,安装便捷,支持多模型。其核心是闭环学习循环,能自我进化,技能可自动生成和更新,记忆系统更优,在多场景有优势,安全设计好。