「视频仿真」共找到 1071 篇相关文章
0.9B跑出90%真机成功率!上海交大为VLA补上空间感
上海交大MINT团队提出中间路线Evo - Depth,约0.9B参数,不额外增硬件负担,兼顾仿真与真机性能及部署效率。系统由IDEM、SEM等组成,代码等已开源。
开源一个拯救你旅行废片的 Skill
作者因旅行照片不尽人意,开发开源 Skill Yingzao · 营造。它风格多样、能检索文化背景,可进行原图对比拼图、多图融合等,适用场景广,还能生成视频,工作方式独特。
VLA别再「走神」:即插即用提升视觉泛化,相对Pi0.5提升18%
至简动力、北大、港中文团队发现VLA模型深层动作预测对关键视觉区域依赖下降,提出DeepVision - VLA框架,在仿真和真实任务中效果显著,能有效提升视觉泛化能力。
生数科技按下B端商业化快进键:30天签约智谱、飞书等多家行业龙头|甲子光年
AI视频生成行业商业化加速,生数科技不到一周官宣与智谱、飞书等合作。其Vidu基座模型能力强,多领域开花,2025年Q1商业化增速快,还凭交付与服务能力获头部青睐。
跨平台智能媒体处理与创作工具箱
pyMediaTools 是基于 PySide6 的跨平台桌面应用,集成媒体批处理和 AI 音视频创作工具。利用 FFmpeg、ElevenLabs 和 Groq API,有格式转换、语音合成等功能,还介绍了安装、配置、打包方法。
3行代码做出自己的数字人,GitHub爆火的国产项目你用上了吗?
中国硅基智能推出HeyGem与DUIX两大开源项目,在GitHub引发热潮。HeyGem能快速克隆数字分身、生成4K视频,DUIX支持实时交互,二者构建完整技术闭环,推动数字人技术普及。
华纳兄弟起诉Midjourney
Theverge消息,华纳兄弟起诉文生图平台Midjourney,称其AI工具生成大量侵犯版权的角色图像和视频,如蝙蝠侠、超人等。诉状列举侵权行为,提供对比案例,华纳希望获禁令并索赔。
不用拍的广告片?深度拆解美团闪购AIGC营销新案例
美团闪购与AI达人共创两支AIGC营销视频,以“技术为品牌说话”。“西游篇”突出“快”,“神话篇”展示“多”,用AI生成“超现实”场景包裹品牌价值,为行业提供营销示范。
AI精准编辑门槛大降:开源框架提升编辑一致性,即插即用
近日,中山大学、香港中文大学等团队发布研究成果ProEdit。它通过对注意力机制和初始噪声潜在分布处理,实现高精度图像与视频编辑,无需训练、即插即用,解决编辑效果与一致性平衡难题。
开源不到一天1.9k星星!NVIDIA新突破,机器人ChatGPT时刻!
NVIDIA开源ProtoMotions3框架,用经典自回归预测和物理仿真,让高级行为涌现。它能助力机器人多方面学习,有望降低人形机器人开发门槛,虽处研究阶段,但提出新思路。