空间音频感知」共找到 903 篇相关文章

产品应用7

实测惊艳全球的Veo3!音画同步无敌,贵是有原因的

谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。

机器之心
算法论文8

谢赛宁团队用RAE实现从8%到84%的飞跃,宣告VAE时代结束

谢赛宁团队用RAE新架构将ImageNet图像生成FID刷到1.13,宣告VAE组件过时。RAE结合先进表征学习成果与强大生成模型框架,解决诸多问题,还为其高维潜空间定制DiTDH架构,性能优异。

AIGC开放社区
算法论文8

登上NeurIPS,Genesis开创无需OCC引导的多模态生成新范式,在视频与激光雷达指标上达到SOTA水平

华中科技大学与小米汽车提出多模态图像 - 点云联合生成框架Genesis,采用两阶段架构和DataCrafter模块。在nuScenes数据集实验显示,其在视频与激光雷达指标达SOTA水平,还提升了下游感知任务效果。

机器之心
产品应用7

我用AI同传干掉了英语发布会,爽。

作者因听不懂英语发布会,借助豆包同传2.0 API自制AI同传工具。虽开发遇诸多难题,但最终用音频重定向解决。该工具能实时翻译,还可复刻音色,也肯定专业译员能力。

数字生命卡兹克
开源动态8

面壁小钢炮 VoxCPM-TTS:开源端到端 TTS,轻量高效低延迟

面壁提出基于扩散自回归建模的端到端语音生成模型 VoxCPM,构建于 MiniCPM - 4 之上。它克服传统离散 token 方法缺陷,实现语义与声学特征解耦,有上下文感知语音生成和零样本语音克隆能力,低延迟。

带你学AI
算法论文8

聊聊Anthropic这篇最新研究,我觉得可能是AI意识诞生的前夜。

Anthropic最新研究《A Global Workspace in Language Models》,在Claude神经网络中发现与人类大脑意识通达结构功能高度相似的J空间,这结构自发涌现,研究还证明其对Claude输出有影响,或改变人类对意识的理解。

数字生命卡兹克
推荐文章8

9月全球值得一看的24件新媒体艺术作品

MANA平台9月分享24件全球新媒体艺术作品,涵盖12个国家,有创意反诈短片、未来零售空间、多媒体舞台等,涉及AI、混合现实等技术,展现艺术与科技融合,还开启投票助力创作者。

MANA新媒体艺术站
开源动态8

字节会师何恺明!开源连续扩散语言模型Cola DLM

字节会师何恺明,开源连续扩散语言模型Cola DLM,释出论文、代码等。该模型跳出离散token束缚,把生成过程交给连续空间,在实验中展现出稳定scaling趋势,其动机是表征而非diffusion。

量子位
算法论文8

后训练中的RL已死?MIT新算法挑战传统后训练思维,谢赛宁转发

MIT研究人员提出RandOpt新算法,挑战传统后训练思维。该算法通过随机扰动和集成突破限制,在多任务中表现出色,揭示了预训练模型权重空间的“神经丛林”现象,引发AI社区关注。

机器之心
新闻资讯8

Google封神,计算机视觉的GPT3时刻来了!

Google Deepmind称在CV领域做出类似GPT-3的成果,Veo 3经大规模训练涌现通用视觉理解和推理能力,能以图片+提示词完成复杂视觉任务,还具备感知、建模等四大超能力。

探索AGI