「音频生成」共找到 2279 篇相关文章
藏师傅开发的 Codepilot 保姆级入门攻略
本文是藏师傅开发的 Codepilot 全平台通用开源 Agent 客户端的保姆级入门攻略,介绍了其特色功能,涵盖安装、配置服务商、聊天、技能使用等方面,助读者快速上手。
AI音乐王座易主!Mureka V8硬刚全球巨头斩获双榜第一,V9即将来袭
AI音乐大模型Mureka V8在权威Artificial Analysis榜单上,斩获vocal与instrument双榜单第一,碾压Suno V4.5等主流模型。其核心技术是MusiCoT,在多维度获正向反馈。昆仑万维还与太合合作,V9将探索创作意图可控表达。
CVPR 2026 | 让AI视频不再「串戏」:免训练精准控制多段动作,SwitchCraft一招破解逻辑崩坏
随着文本到视频扩散模型发展,AI视频生成有进展,但开源模型处理多事件提示词时存在技术瓶颈。西湖大学团队提出免训练框架SwitchCraft,引入注意力控制机制,入选CVPR 2026,代码已开源。
做RAG这一年,最后悔的就是上知识图谱
基于知识图谱的检索增强生成在问答任务中存在三元组索引丢失上下文语义问题,作者提出MDER - DR双阶段框架,在标准测试和特定数据集上性能提升最高66%,还具备多方面优势。
对话 Befreed 创始人:从「个人学习」切入的 AI Agent,把学习变成一种生活方式
文章对话 Befreed 创始人 Jisong Liu ,介绍其以「强个性化学习 Agent」为核心的音频学习产品,它能把零散学习累积成知识路径,采用订阅制,有付费转化,还分享了创业、社媒运营等经验。
港大赵恒爽团队论文:让扩散模型既拿高分又不「作弊」丨CVPR 2026
扩散模型虽能生成逼真图像,但存在“奖励作弊”问题。港大赵恒爽团队提出 GDRO 后训练方法,引入组级奖励优化机制,提升模型表现、缓解作弊,还提高训练效率,有明显工程价值。
大象秒变挖掘机!三维变形新突破,无需额外训练 | CVPR'26
南京大学与北京大学提出MorphAny3D,无需额外训练即可让三维生成模型实现跨类别平滑变形。它通过创新注意力机制融合源与目标特征,精准控制结构与时序,效果远超传统方法,代码已开源。
Claude 新增交互式图表和示意图,免费能用
Claude 新增交互式图表和示意图功能,付费与免费用户均可在聊天中直接生成。通过虚构建筑系学生 Andrea 的使用场景展示,如职业探索卡片、结构力学荷载图等,将工具嵌入成长故事线。
一年一度最值得关注的AI榜单来啦!申报即日启动
中国生成式AI进入产业深水区,值第四届中国AIGC产业峰会,量子位将评选2026年度值得关注的AIGC企业和产品,介绍了参选条件、评选维度,即日起报名,4月27日截止,结果5月峰会公布。
我们做了比你更懂 Java 的 AI-Agent -- Arthas Agent
Arthas是强大的Java诊断工具,但门槛高。Arthas Agent可将自然语言意图转化为Arthas操作,输出诊断报告。它技能优先、安全优先、循证闭环,通过多案例展示其诊断优势,还介绍使用方法和提效建议。