视听分离」共找到 121 篇相关文章

开源动态8

智源新出OmniGen2开源神器,一键解锁AI绘图「哆啦 A 梦」任意门

2024年9月智源研究院发布统一图像生成模型OmniGen,获社区好评。近期OmniGen升级为OmniGen2,增强多方面能力且全面开源。它采用新架构与策略,有反思机制,玩法丰富,还推出新基准优化部署。

机器之心
产品应用7

个人音频转录与交互神器

Speakr是个人自托管网络应用,可转录音频、生成摘要和标题,还能通过聊天互动。支持音频上传、浏览器录音等功能,可选择不同转录方式,有简单和高级两种安装方法。

GitHubStore
新闻资讯7

“无限可能”AI视频竞演第二阶段结果揭晓,11部作品入围深圳路演大会

3月8日,“无限可能”AI视频竞演完成二阶段评审,11部作品从50部入围作品中选出,晋级3月14日深圳路演大会。作品经“幻镜”AI视听测评季第三季测评,结果将现场公布。

郎园Station
开源动态8

X 推荐算法开源,暴力拆解推荐机制,这是内容创作者的终极流量增长秘籍。

马斯克兑现承诺,将X推荐算法开源。文章用通俗语言介绍其运作原理,把推荐系统比喻成两个‘内容买手’和一个‘裁判’,还给出内容评分标准、过滤机制及创作者提升流量的实战建议。

开源AI项目落地
开源动态7

OVI:统一的音视频生成模型,声音与画面同步诞生

音视频生成领域以往多阶段架构易致音画不同步等问题。耶鲁大学团队提出 OVI 统一范式,采用双塔 DiT 架构与分块式跨模态融合机制,实现音画同步生成,不过目前有计算开销大、音频有局限等问题。

带你学AI
算法论文8

谢赛宁团队新作:不用提示词精准实现3D画面控制

谢赛宁团队新发布的Blender Fusion框架,结合图形工具 (Blender) 与扩散模型,让视觉合成不再仅依赖文本提示,实现精准画面控制。其核心是对现有技术高效组合,还透露两项训练技巧提升泛化性。

量子位
开源动态8

当Sora 2意外停摆,这个国产视频生成创业团队,直接「开源」三连击

OpenAI叫停Sora 2项目,同期北京AI初创公司Sand.ai在GitHub连续三天开源核心技术栈,包括音视频同出大模型、分布式Attention组件、全局编译框架,还介绍了团队和产品,展现全栈实力。

机器之心
开源动态7

AI 智能体界的 npm 来了!Vercel 推出 Skills.sh,欲统一智能体指令集

Vercel 发布开源项目 Skills.sh,为 AI 智能体打造“标准动作库”,让其通过命令行执行可复用操作。它是开放生态,开发者能定义、分享指令。项目获广泛关注,社区认为其实用性强。

InfoQ
产品应用7

一步步实战 CopilotKit(AG-UI协议):生成式 UI 与集成 Human-in-the-Loop【下】

文章延续上篇Demo,探索CopilotKit在重要场景的应用,如基于Agent的生成式UI、HITL人类参与流程等。展示了相关实例操作步骤与前端效果,指出其为构建智能应用奠定基础,降低AI融合门槛。

AI大模型应用实践
产品应用7

Current Robotics 发布 Curr-0:以 Single Policy 实现全身灵巧操作

Current Robotics发布Curr - 0,解决人形机器人移动与操作分离困境。它用Single Policy统一训练,基于HumanEx采集数据,还构建多物理模态交互世界模型,是全栈具身智能基础设施成果。

AI科技评论