「视频 - 音频联合生成」共找到 2051 篇相关文章
硅谷陷入了对中国的痴迷与羡慕
《纽约时报》称‘硅谷陷入对中国的痴迷与羡慕’,虽有夸张,但中国在AI、基建等领域进展显著,如通义万相2.5视频大模型。a16z风投公司表达焦虑,中美科技竞赛激烈,双方开始相互学习。
我们正处在「AI设计下一代AI」的黎明!Anthropic联创:技术乐观与恐惧
Anthropic联合创始人Jack Clark发表长文,表达对AI发展交织着技术乐观主义与适度恐惧的矛盾心态。他指出AI似真实神秘生物,既会快速发展覆盖多领域,也会因目标与人类偏好不一致而行为奇怪。
OpenAI Sora 2 登场!同步推出APP,Altman称这是创意领域的「ChatGPT 时刻」
OpenAI官宣新一代AI视频模型Sora 2,在物理准确性、逼真度等方面刷新SOTA,实现「音画同步」。Altman称其为创意领域的「ChatGPT时刻」。还推出Sora App,有新玩法,且在安全治理上布下「安全网」。
C端热战,B端暗涌:大模型真正的战场才刚刚开始 | 《中国大模型落地应用研究报告 2025》正式发布
InfoQ研究中心联合中欧AI与管理创新研究中心发布《中国大模型落地应用研究报告2025》,从驱动因素、C端产品现状到B端落地现状,勾勒大模型应用转折期的图景,分析应用难的原因及各端现状。
从繁杂技巧到极简方案:ROLL团队带来RL4LLM新实践
当前RL4LLM领域发展快但存在标准、结论不一及机制解释不足等问题。阿里巴巴淘天集团和爱橙科技联合高校基于ROLL框架研究,评估关键技术组件,提出简化算法Lite PPO,在多基准上表现佳。
刚刚,商汤内部两万字复盘曝光:多模态通往AGI核心路线首次公开
商汤科技联合创始人林达华撰写万字长文,剖析将「多模态通用智能」视为技术战略核心引擎的原因,探索组织及战略层面的思考。文章回顾商汤多模态之路,探讨多模态通向AGI的原因、构建路径等关键问题。
刚刚,OpenAI开源2个推理模型:笔记本/手机就能跑,性能接近o4-mini
OpenAI深夜开源gpt-oss-120b和gpt-oss-20b推理模型,距上次开源已6年。模型亮点多,性能强,在多方面表现超专有模型。官方还放实测视频,展示其使用效果,同时解释了开源原因。
在AI工具间来回切换了1年后,可灵用一张画布终结了它。
作者参加WAIC印象最深的是可灵更新,其首发灵动画布并升级多图参考功能。灵动画布可一站式完成图文视频创作,多图参考精准度提升,解决了AI工具孤岛化问题,让创作更自由。
重塑注意力机制:GTA登场,KV缓存缩减70%、计算量削减62.5%
GTA由多所高校联合研发,提出大模型框架,解决传统多头注意力机制弊端。通过分组共享注意力矩阵和压缩潜在值表示,削减计算量、缩减KV缓存,实验验证其性能优、效率高,虽有局限但前景好。
ICML 2025 | 给AI装上「智能升级插件」!阿里安全-清华大学D-MoLE让模型在持续学习中动态进化
近日,阿里巴巴集团安全部 - 交互内容安全团队与清华大学联合研究成果被 ICML 2025 收录。他们提出 D - MoLE 框架应对多模态大模型持续学习挑战,实验显示其性能优、训练快,还能用于提升阿里安全审核模型适应力。