「音频生成」共找到 2274 篇相关文章
仅保留35% Token,性能反超原模型!快手可灵等用视觉信息引导音频压缩,推理时间直降42%
Omni - LLM计算浪费严重,快手可灵等团队提出OmniSIFT框架。它利用音视频非对称依赖关系,通过时空联合剪枝压缩视频、视觉引导筛选音频Token,大幅减少Token数量,提升性能和推理效率。
《TAML》好文推荐 | 来自清华大学张宇飞团队最新研究成果 基于文本生成翼型:FoilCLIP,一种语言驱动的气动设计新框架
传统翼型设计依赖CFD和风洞试验,成本高。清华大学张宇飞团队提出端到端双向映射框架FoilCLIP,通过对比学习建立文本与翼型几何双向映射,还提出数据增强策略,验证了其在语言驱动设计中的应用潜力。
我手搓了一个Seedance 2.0分镜Skill:一键生成电影级Prompt,再也不用为提示词发愁了
作者为解决用Seedance 2.0写分镜提示词难题,手搓Seedance Storyboard Skill。它能引导用户完成分镜细节,输出专业提示词。作者实测4种风格案例效果佳,还介绍了Skill原理、安装使用方法。
老黄在CES 2026 上预言:将要告别应用软件的预编译时代,未来的应用是 GPU 上实时生成每一个像素
黄仁勋在CES 2026预言,应用将告别预编译时代,在GPU上实时生成像素。他回顾2025年AI关键进展,介绍Agentic AI特点与能力,还谈了其搭建及应用前景,指出未来软件或基于Agent交互。
不看后悔!GitHub 开源 MultiTalk .8k star 强大的人语音+图像绑定项目
MultiTalk 是 MeiGen‑AI 开发的开源框架,可从音频、图片和提示语生成多人对话视频。它解决传统视频制作痛点,功能亮点多,技术优势明显,应用场景广,与同类项目对比表现突出。
语音“PS”来了!蚂蚁又放大招,ASR+TTS+编辑的全能语音模型开源了!
在大模型浪潮下,语音领域迎来“整合与统一”趋势。阿里蚂蚁团队推出端到端统一语音模型Ming - UniAudio,能在一个框架下完成识别、生成、编辑等任务,语音编辑能力创新,开发者上手简单。
真可用!美团数字人模型开源,MV、电商等统统拿下
美团开源数字人视频生成框架 LongCat - Video - Avatar 1.5 版本,换音频编码器、加速推理,支持多任务与多场景。经770人评测,它在多维度领先对手,各方面表现均衡,效率与质量兼得。
完爆ChatGPT!谷歌这招太狠:连你的「阴阳怪气」都能神还原
谷歌发布Gemini 2.5 Flash原生音频模型,可保留语调进行实时语音翻译,实现拟人化交互。还具持续监听、风格迁移等功能,提升开发者所需的函数调用、指令遵循等能力,另有实验产品Disco。
小红书,再造一个更有「声」命力的社区
2026年春节,小红书开放多种AI语音新玩法,如语音发布、评论、问一问等,增强社交趣味性。但AI语音落地面临音频理解、生成活人感和响应速度等问题。小红书有天然优势,技术团队自研模型达SOTA水平。
百万规模数据集打造人形机器人通用大模型,实现精细动作跨平台、跨形态动作迁移丨北大人大联合发布
北大和人大团队在通用人形机器人动作生成领域取得重大突破,首创通用动作生成框架Being - M0,构建百万规模动作生成数据集MotionLib,研发文本驱动动作生成模型,实现人体动作向多类型人形机器人迁移,文章将发表于ICML2025。