语音数据集」共找到 2815 篇相关文章

开源动态8

AI开始玩乐高了?我拼一小时的乐高,它几秒就搭好,LegoGPT开源了!

卡内基梅隆大学提出LegoGPT,是首个依文本提示生成物理稳定乐高积木模型的方法。构建了StableText2Lego数据,训练自回归大模型生成设计,还开发纹理生成法,设计能手动或机器人组装。

带你学AI
算法论文8

夜光影像里的"暗船":双分支 YOLO11 如何用抓非法捕捞

非法捕捞的暗船常关掉 AIS 隐身,难被传统手段监控。论文提出双分支 YOLO11,通过夜光遥感数据精准检测,还设计预处理流程,在测试表现优,规模化应用也得到暗船率等成果。

机器学习AI算法工程
开源动态8

“AI大神”李沐终于开源新模型,爆肝6个月,上线迅速斩获3.6k stars!

7月23日,“AI大神”李沐开源音频基础模型Higgs Audio v2,构建于Llama - 3.2 - 3B之上,预训练数据丰富。该模型在多个测评中成绩领先,有多种能力,李沐介绍其技术及训练方法。

AI前线
算法论文8

一键开关灯!谷歌用扩散模型,将电影级光影控制玩到极致

Google推出LightLab项目,可从单张图像精准控制光影,解决传统光影控制难题。其通过特殊数据微调扩散模型,让模型学会控制光照,还介绍了方法、后处理流程等,实验显示表现优,有多种应用。

机器之心
新闻资讯7

Meta正炼化老板:24小时不间断工作,扎克伯格真成机器人了

《金融时报》爆料,扎克伯格正将自己炼成“代理CEO”扎克bot,由其影像和语音数据训练,本人也参与其中。超级智能实验室攻克相关技术难题,Meta还开发“CEO Agent”,但项目上线或面临问题。

量子位
产品应用8

360发布全球最强视觉语言对齐模型!榜单全面领先!

360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。

AIGC开放社区
算法论文7

谷歌:Embedding检索存在根本理论局限,Sparse、Graph才是未来?

近年来稠密向量检索广泛应用,社区认为embedding能‘包打一切’,但谷歌DeepMind从理论与实验指出其存在根本局限。相关实验代码和数据已开源,还给出替代方案。

PaperAgent
算法论文8

ACL 2026|清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成!

现有文生音频技术在精细化控制方面有挑战,清华团队提出ControlAudio方法。它通过数据构造、渐进式训练和引导采样,在统一框架下实现时间与语音内容联合建模,在多项任务上表现优于现有方法。

机器之心
算法论文8

谢赛宁×李飞飞×LeCun首次联手!寒武纪-S「空间超感知」AI震撼登场

Yann LeCun、李飞飞和谢赛宁联手发布论文「Cambrian - S:迈向视频中的空间超感知」。他们认为LLM虽能力强,但无法像人类一样感知世界,为此构建Cambrian - S系列模型,开源相关数据和模型,还开发了新原型。

新智元
开源动态8

不止动起来:SentiAvatar重新定义3D数字人动作生成范式

AI 初创公司 SentiPulse 联合团队提出 3D 数字人动作生成新范式 SentiAvatar,打造虚拟角色 SUSU,其框架等已全球同步开源。它解决了高质量数据荒等问题,实验表现优,还实现快速动作生成,支持流式交互。

机器之心