音频超分辨率」共找到 2243 篇相关文章

新闻资讯7

MMAR与AudioTrust技术解读,音频大模型评测前沿进展分享 | AI Bench Talk直播预告

司南评测集社区 CompassHub 收录多维度评测集。此次 AI Bench Talk 直播聚焦音频大模型,将分享评估其深度推理能力的 MMAR 及全方位可信评估框架 AudioTrust,还设圆桌讨论多模态/音频大模型相关议题。

OpenMMLab
开源动态8

微软重磅开源!22K星的 VibeVoice 再添新成员,60分钟音频 ASR 端到端统一输出!

现在的 ASR 模型处理长音频存在断章取义、说话人错乱等问题。微软开源 VibeVoice-ASR,可一次性处理 60 分钟音频,实现“三位一体”输出,补齐 VibeVoice 生态,还介绍了特点、架构、使用方法与应用场景。

开源星探
产品应用7

机器人是具身大模型的「用户」:维动力如何打通从人类经验到机器人行动?

今年WAIC,维动力展台的乒乓球桌和双臂机器人开易拉罐演示吸引关注。其机器人90%经验来自人类第一视角数据,维动力全栈布局,试图打通人类经验到机器人行动链路,目标是建立机器人持续进化方式。

机器之心
算法论文8

华为树HTP:不写示例、不调PDDL,AI规划约束通过率飙升62.6%

文章介绍华为树HTP,它是完全自主、可泛化的推理新范式。能让LLM在树结构上完成规划,不依赖人工示例和外部规划器,在复杂规划benchmark上实现SOTA准确率并降低token成本,还阐述其原理、创新点及应用实例。

CourseAI
产品应用7

低延时、可交互的音频驱动肖像视频生成框架LLIA

美团提出新型音频驱动肖像视频生成框架LLIA,是低延迟、可实时交互的虚拟形象生成技术。它提出四项核心技术,引入三大核心模块,构建100小时数据集,在多方面有出色表现。

带你学AI
8

华师大智金院孵化金融原生基模Mint-Agent:越GPT-5.6与Claude Opus 4.8,商业订单已亿元

华东师大智金院团队孵化的金融原生基模 Mint - Agent 发布,在 FinanceAgentBench v2 上表现 GPT - 5.6 - Sol 与 Claude Opus 4.8,单题推理成本低,商业订单亿元,进入规模化金融场景验证阶段。

机器之心
新闻资讯7

独家|拿下5亿元海外订单,无界动力完成天使++轮融资,天使轮累计融资2亿美元

AI科技评论独家获悉,通用具身智能机器人公司无界动力完成天使++轮融资,累计2亿美元,天使+++轮也接近完成。其以隐空间世界模型构建具身大脑,区别于主流架构。还获远景5亿订单,商业化落地成果多。

AI科技评论
开源动态7

Claude时代终结?LMArena实测DeepSeek R1编程得分Opus 4,但月暗称其新模型更胜一筹

在闭源模型主导的AI环境下,开源的DeepSeek - R1(0528)在LMArena测试中表现亮眼,编程得分Claude Opus 4,引发社区关注与讨论。不过LMArena曾被指责偏袒,其联合创始人反驳。此外,月之暗面新模型Kimi - Dev - 72B编程成绩R1。

AI前线
开源动态7

17K star 火!给你的电脑装上永不遗忘的AI记忆,100%本地运行!

介绍开源项目`screenpipe`,它能7×24小时记录屏幕和音频数据,100%本地运行,保障隐私。对比同类项目Glass,指出两者异同及适用人群,还介绍了安装使用方式。

开源先锋
产品应用7

Qwen深度研究一夜升级!可生成网页和音频播客,新模型能认医生手写体

Qwen版深度研究加速进化,增加听觉和视觉输出,可生成网页和音频。改进功能同时更新模型,Qwen3 VL能识别医生手写体。实测新功能表现出色,Qwen3-VL系列更新后性能优异。

量子位