音频超分模型」共找到 8788 篇相关文章

算法论文8

750篇论文,彻底把统一多模态模型摸清了

未来迈向AGI需多模态AI系统。南大等联合发表综述,涵盖754篇文献。分析传统路线痛点,介绍统一多模态模型定义、技术路线、训练方法等,还提及应用场景及未来方向。

PaperAgent
产品应用7

SkyReels-Audio让嘴型和音频完美匹配不再难

音频驱动的动态人脸生成研究较少,昆仑万维提出SkyReels - Audio框架,基于预训练视频扩散变换器构建,支持无限长度视频生成与编辑,采用混合课程学习等策略,保障视频视觉保真度和时间一致性。

带你学AI
推荐文章7

“煽风点火”让大模型“卷”起来的提升性能的套路

网友Greg Isenberg分享让AI提升性能的方法,通过利用不同AI模型如ChatGPT、Claude、Grok间的“竞争”,人为制造竞争环境,激发其潜力,可提升输出效果,且方法获很多网友验证认可。

AI工程化
产品应用8

模型测试不再跳来跳去,VS Code + Hugging Face = 真香

Hugging Face 发布新功能,让开发者在 VS Code 的 GitHub Copilot Chat 中直接接入 Inference Providers,可调用 Kimi K2 等开源大模型测试,无需频繁切换平台。该功能有统一 API 等优势,定价门槛低。

InfoQ
开源动态8

【万字长文】大模型开源开发全景与趋势解读

本文以蚂蚁开源团队视角,基于OpenDigger数据,分析大模型开源开发生态。呈现2025年全景图,涵盖135项目。指出训练、推理、应用侧主导领域,还探讨生态趋势、项目兴衰及近期厂商动态。

InfoQ
开源动态8

英伟达开源全新大模型:黄仁勋不想只「卖铲子」

2025年底英伟达宣布开源全新模型家族Nemotron 3,含Nano、Super和Ultra。它融合Mamba、Transformer和MoE技术,有诸多创新。这不仅是产品更新,更是战略突袭,标志着英伟达想构建AI闭环开放生态。

新智元
产品应用8

模型即 Agent 的含金量:Kimi深度研究功能详评

作者分享Kimi深度研究功能体验。其基于端到端自主强化学习技术,会开源模型。在测试中,分析Labubu爆火原因、检索小米发布会内容,展现出强逻辑分析、搜索准确性和数据处理能力,可视化网页也出色。

歸藏的AI工具箱
产品应用8

这篇有用!手把手教你搭建 AI 产品 Evals

文章指出AI下半场模型评估比训练更重要,做好Evals是当下AI产品开发刚需。介绍了Evals重要性、三种方法、通用评估标准等,还教你从零构建Evals及设计注意事项,助你快速上手评估。

Founder Park
新闻资讯7

内存涨势黄金,带飞1400亿存储巨头

9月起存储芯片价格疯涨,国内“存储一哥”兆易创新第三季度净利润暴增61%,市值1400亿。其创始人朱一明布局20年,使公司完成“三级跳”。不过,行业有周期性,兆易创新需应对挑战。

芯师爷
新闻资讯8

谷歌卷Gemini模型,OpenAI刷GPT-5科研论文

谷歌推出Gemini 3 pro等模型,来势汹汹。OpenAI CEO称其带来经济阻力,还挖掘GPT - 5应用价值并发表89页论文,展示在科研流程中的表现,也提及失败风险与可用Prompt模板。

PaperAgent