「开源音乐模型」共找到 9023 篇相关文章
电脑操作、技能、连接器、工作伙伴:豆包的牌来了
最近字节有两个豆包相关新闻,一是在训练超大模型,二是反对模型蒸馏。豆包上线大批 Agent 相关工作任务能力,覆盖办公场景,如电脑操作、技能商店等,过程流畅且可观察,还更新移动端,实现远程控制。
1/10成本、Opus 4.7级表现,Cursor甩出了性价比之王Composer 2.5
Cursor推出新模型Composer 2.5,成本仅为Claude Opus 4.7的1/10,性能几乎追平。它更智能,擅长处理长时任务,遵循复杂指令更可靠。未来一周使用额度翻倍,还宣布与SpaceXAI合作训练新模型。
深度访谈|OpenClaw引爆Agent元年,AI Agent在企业内如何规模化应用?
2026年初,开源智能体项目OpenClaw爆火,让AI从“对话框里的顾问”变为“现实世界中的执行者”。本文围绕“从OpenClaw爆火到企业级Agent落地”展开,探讨AI Agent的应用问题、开源生态格局等,还给出企业部署建议。
视频生成太慢?英伟达、谢赛宁等发布TMD框架,实现70倍加速
大规模视频扩散模型采样效率低,应用受限。英伟达联合谢赛宁等提出TMD框架,将大型视频扩散模型蒸馏为少步生成器。实验显示,TMD能实现超70倍加速,质量损失小,用户也更偏好其生成的视频。
OpenAI为龙虾紧急收购了一家23人公司
OpenAI前脚挖来龙虾之父,后脚收购专注AI安全与评测的初创公司Promptfoo。该公司开源评测框架流行,有30多万开发者用户。收购后将补齐OpenAI在‘龙虾安全’方面关键一环,且继续保持开源。
何恺明带大二本科生颠覆扩散图像生成:扔掉多步采样和潜空间,一步像素直出
何恺明团队提出新方法Pixel Mean Flow(pMF),突破传统扩散模型/流模型限制,砍掉多步采样和潜空间,一步在像素空间生成图像,在ImageNet不同分辨率上取得佳成绩,还介绍了核心设计、实验结果对比等。
谷歌发布 Gemma Scope 2,深化对 LLM 行为的理解
Gemma Scope 2 是谷歌推出的解释 Gemini 3 模型行为的工具,结合稀疏自编码器和转码器,能让研究人员检查模型内部表示。它从多方面扩展了原先的 Gemma Scope,还引入针对聊天机器人的分析工具,已发布权重。
POF|西工大廖晖、刘溢浪等:数据驱动的湍流建模:基于符号回归与数据同化的双向耦合框架
针对传统湍流模型在高雷诺数分离流动中精度不足与耦合不稳定问题,本文提出融合符号回归与数据同化的白箱建模框架(DASR)。该方法提升了模型稳定性与预测准确性,在复杂条件下有良好泛化能力。
ICML 2025 | 清华、上海AI Lab等提出傅里叶位置编码,多项任务远超RoPE
长文本能力对语言模型重要,但现有模型训练窗长有限,流行的RoPE也有局限。清华、上海AI Lab团队用傅里叶分析解读其不足,提出傅里叶位置编码FoPE,提升长文本泛化能力,实验表现超RoPE。
Anthropic:警惕评测排行榜!差别可能只是机器的内存更大,而已
Anthropic发工程博客指出,AI编程评测排行榜上排名前列的模型分差小,而运行环境硬件配置能让分数波动6个百分点。同一模型在不同沙箱策略下分数不同,资源配置影响评测结果,排行榜分数差距或因硬件。