音频超分模型」共找到 8772 篇相关文章

开源动态8

最低仅需2G显存,谷歌开源端侧模型刷新竞技场纪录,原生支持图像视频

今天凌晨,谷歌官宣Gemma 3n,原生支持多模态。它在大模型竞技场1300分,是首个此分数的10B以下模型。其VRAM占用低,最低2GB,已在谷歌AI Studio等可用,还公开了技术细节。

量子位
算法论文8

北大联手通义实验室发布ZeroSearch:成本暴降88%,无需搜索即可激活大语言模型的检索能力!

北大与通义实验室发布ZeroSearch框架,可无需真实搜索激活大语言模型检索能力。它引入大语言模型模拟搜索、采用结构化模板等策略,成本降88%,多项实验显示其性能越基线与真实搜索方法。

深度学习自然语言处理
算法论文8

突破LLM数据瓶颈:Meta等提出语言自我博弈,一台模型,两个角色,无限进化

Meta等团队提出“语言自我博弈”(LSP)框架,让语言模型自己和自己“玩游戏”,在无外部数据输入下自我改进。实验显示,其性能可媲美甚至越用大量人类数据训练的模型,为缓解数据稀缺提供新思路。

深度学习自然语言处理
算法论文7

多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距

近年来,多模态大模型在多种场景取得进展,但能否‘看懂图’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁图理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。

量子位
开源动态8

SOTA级的Embedding模型!F2LLM模型、数据、代码全部开源,人人可用

Embedding 模型应用广泛,但主流模型训练困难。蚂蚁集团与上海交大推出 F2LLM,含 0.6B、1.7B、4B 系列模型,仅用六百万数据微调基座,在 MTEB 榜单领先且完全开源。介绍了其数据、训练、测评等情况。

深度学习自然语言处理
新闻资讯8

AI 的下一个战场:端侧模型崛起

模型退烧,小模型接棒。腾讯、阿里等大厂纷纷官宣小模型成果,英伟达、OpenAI 等也有相关动作。端侧模型赛道广阔,但技术含量不低,面壁智能在端侧模型探索上成果丰硕,其 MiniCPM 系列不断迭代,还在多领域落地。

AI科技评论
开源动态8

开放全栈!越π0,具身智能基础大模型迎来真·开源,开发者狂喜

继π0后,具身智能基座模型WALL - OSS正式开源,多项指标越π0。它是通用多模态具身模型,具良好推理和泛化能力。背后自变量机器人刚完成近10亿A + 轮融资,开源将降低具身智能门槛。

量子位
算法论文8

LeCun世界模型:48倍规划速度,单卡就能跑

Yann LeCun团队推出LeWorldModel世界模型,仅靠两条数学规则,让机器几小时学会物理运转逻辑,动作规划速度同类48倍。它跳出复杂训练修补怪圈,单卡训练,在多环境测试表现出色,还展现对物理法则的深刻理解。

AIGC开放社区
开源动态8

重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!

传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B多模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于多场景。

开源星探
开源动态8

全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型Intern-S1 | WAIC 2025

7月26日,上海AI实验室在WAIC 2025上发布并开源科学多模态大模型Intern-S1。它融合多学科知识,首创跨模态科学解析引擎,在多学科任务上越顶尖闭源模型,还支撑构建了多智能体系统。

机器之心