语音数据」共找到 2698 篇相关文章

推荐文章7

具身智能中的 VLA 技术及其应用

文章围绕具身智能中 VLA 技术展开,介绍其现状、挑战、架构、数据方案及部署等内容。指出 VLA 虽推动具身智能发展,但面临数据、模型结构等挑战,还探讨了不同架构优劣及未来探索方向。

InfoQ
算法论文8

一篇400+文献最新RAG技术系统性综述

本文对RAG技术进行系统性综述,通过筛选5大数据库、128篇高被引文献、343个数据集,给出技术地图、评估框架与未来路线,梳理技术全景、评估指标,还介绍主流数据集,指出RAG已演变为复杂系统。

PaperAgent
产品应用8

懂方言,通诗词,精通30国语言,阿里发布语音识别大模型Fun-ASR1.5

阿里发布语音识别大模型Fun - ASR1.5,可精准识别30种语言,覆盖中文七大方言体系及二十余种地方口音,强化古诗词诵读专项识别,后处理环节优化标点预测和文本归一化,降低人工成本。

千问大模型
产品应用8

从0到1拆解FreeWheel ChatBI:大模型如何重塑视频广告智能数据分析新生态

本文结合 FreeWheel 实际应用经验,分享构建 ChatBI 系统核心实践。介绍其核心功能、技术实践,如让 LLM 理解业务、智能选表等,还提及系统架构、算法服务,最后总结上线效果并展望未来优化方向。

InfoQ
算法论文8

0人工参与实现梯度更新!MIT新框架让AI自动生成微调数据,权重自主升级

MIT提出新强化学习框架SEAL,可让模型生成微调数据和自我更新指令,实现权重更新。无需人工,模型能自动梯度更新。经知识注入和小样本学习实验验证效果,还介绍了其双循环工作机制。

量子位
开源动态8

阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源

阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。

量子位
新闻资讯7

医疗AI新标准来了!现公开征集起草单位和专家!

当前人工智能与医疗卫生融合机遇大,国家有相关规划,市场规模将大增。但医疗AI发展受数据安全与隐私保护制约。现智合标准中心等组织编制全国首部医疗AI数据安全团体标准,还公开征集起草单位和专家。

AI工程化
开源动态8

Chain-of-Agents: OPPO推出通用智能体模型新范式,多榜单SOTA,模型代码数据全开源

OPPO个性化AI实验室团队推出智能体推理范式CoA及模型AFM,解决传统多智能体系统通信效率低等问题。AFM在近20项测试中刷新记录,降低推理成本,还介绍了架构、数据构建等,也指出待探索方向。

机器之心
开源动态8

用3万小时触觉数据补齐具身智能「手感」,新智具身联合复旦大学统一触觉「方言」

新智具身联合复旦大学发布三份技术报告,将触觉跃升为具身智能核心基建。构建3万小时交互语料库统一触觉“方言”;提出新方案让机器人提前预判触觉;在世界模型中重构“触觉想象”,推动具身智能“视触融合”。

机器之心
开源动态8

Qwen3-ASR开源:够稳定,能流式,多语言!

今日正式开源Qwen3-ASR系列模型,含两个语音识别与一个语音强制对齐模型,支持多语种。依托创新技术实现精准稳定识别,1.7B模型多场景达SOTA,0.6B兼顾性能效率,强制对齐模型精度超传统模型。

千问Qwen