音频向量模型」共找到 7829 篇相关文章

开源动态8

开源音视频同步SOTA基座:极简的单流架构,2秒出片

AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。

AIGC开放社区
产品应用8

小米AI语音新框架:人人都能当声音导演

小米大模型应用团队提出Midasheng - audio - generate与Xiaomi Any2Speech两大音频生成框架。前者可实现全场景声音重建,后者让AI学会理解声学空间与叙事逻辑,改变了语音合成应用场景与思路。

量子位
算法论文7

谷歌:Embedding检索存在根本理论局限,Sparse、Graph才是未来?

近年来稠密向量检索广泛应用,社区认为embedding能‘包打一切’,但谷歌DeepMind从理论与实验指出其存在根本局限。相关实验代码和数据已开源,还给出替代方案。

PaperAgent
开源动态8

开源AI开发生态大洗牌:低代码平台逆袭,传统LLM框架日渐式微

第十届527蚂蚁技术日,蚂蚁对现有开源生态全面剖析,发布2025大模型开源生态全景图。分析显示开源生态有三个主导技术赛道,还总结出七大趋势,为从业者提供生态演进规律参考。

量子位
算法论文8

单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器

人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。

新智元
新闻资讯7

他们在1993年就提出了Scaling Law

原来,Scaling Law在32年前就被提出了,不是2020年的OpenAI、不是2017年的百度,而是1993年的贝尔实验室。在一篇文章里提出一种预测方法,研究人员可以预测模型在更大数据集上的表现,这和现在大家常提的Scaling Law几乎一致。

量子位
开源动态8

Meta最新REFRAG框架引爆RAG圈!KV缓存暴降90%,速度狂飙30×

Meta推出REFRAG框架解决RAG难题。它能在不修改解码器参数下压缩上下文、复用文档向量等。实验显示,它降低KV缓存、加速TTFT,在多任务表现佳,为大模型与知识库结合提供新范式。

CourseAI
新闻资讯9

刚刚,中国语音AI连拿多项全球第一!

本文报道阶跃星辰推出StepAudio 3全系列五款音频模型,覆盖听、说、理解、交互、创作全语音链路,拿下三项第三方评测全球第一,分析了语音AI行业从单点竞赛转向全栈体系竞争的新趋势。

新智元
开源动态8

昆仑万维多模态视频生成开源,影音图文全统一

昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。

AIGC开放社区
产品应用8

豆包 Seed 2.0 Lite升级:给 Agent 装上眼睛和耳朵

近期模型发布竞争激烈,作者做视频字幕常遇识别错误,因语音识别工具缺上下文。字节方舟的豆包 Seed 2.0 Lite 升级后能听,还可结合上下文准确输出字幕,成本降 20%,也能理解视频,为工作流补全感知。

花叔