视频扩散Transformer」共找到 1372 篇相关文章

推荐文章8

11Labs 增长负责人:搞营销要学着做视频,但创始人出镜会有点自恋

AI语音独角兽ElevenLabs增长迅猛,估值超30亿美元。其增长负责人Luke Harries分享独特策略,如分业务单元管理、重视视频营销、多渠道推广等,还给出团队搭建、产品发布等实用建议。

Founder Park
产品应用8

每帧Sora级震撼!Midjourney首个视频模型登场,超逼真大片首测来袭

Midjourney首个AI视频模型V1上线,每月10美金可体验20秒。其视觉效果惊艳,能媲美Sora等,还能一键让图像动起来。成本低,提供多种模式与设置,有技术愿景,未来将完善模块。

新智元
算法论文8

VAE再被补刀!清华快手SVG扩散模型亮相,训练提效6200%,生成提速3500%

前脚谢赛宁宣告VAE在图像生成领域退役,后脚清华与快手可灵团队就推出无VAE潜在扩散模型SVG。它通过语义+细节双分支+分布对齐,实现多任务通用,训练提效62倍、生成提速35倍。

量子位
算法论文8

CVPR 2026|1分钟单图变4D视频!AI看图直接脑补物理规律

北京理工大学和理想汽车等团队提出全新框架PhysGM,引入DPO实现端到端快速前馈推理,能1分钟内将单图生成为4D动态视频,在速度和评价指标上超越主流模型,相关工作被CVPR 2026接收且代码已开源。

机器之心
新闻资讯7

全网破防,AI「手指难题」翻车逼疯人类!6根手指,暴露Transformer致命缺陷

最近网友被AI「手指难题」逼疯,给AI六指手,它始终无法数对。GPT - 5.2、Nano Banana Pro等均翻车。此问题揭露当前模型思考机械、割裂等缺陷,也凸显Transformer架构弱点。

新智元
开源动态8

文档秒变演讲视频还带配音!开源Agent商业报告/学术论文接近人类水平

澳大利亚和英国多所高校团队提出多模态智能体PresentAgent,能将文档转化为配有语音讲解和同步幻灯片的视频演示。其模块化生成框架有可控性和领域适应性,评估显示它在各指标上接近人类水平。

量子位
算法论文8

太巅了!MIT老哥在Transformer里造了台计算机,LLM从此不需要调用外部工具?

LLM在数学推理表现佳,但纯计算是短板。MIT的Christos Tzamos团队在Transformer内造计算机,实现WebAssembly解释器,解决数独难题,还突破注意力机制瓶颈,打开软件与神经网络新接口。

AI寒武纪
新闻资讯7

「我受够了Transformer」:其作者Llion Jones称AI领域已僵化,正错失下一个突破

颠覆性论文《Attention is all you need》作者之一Llion Jones在TED AI大会称厌倦Transformer。他认为AI领域资源多但创造力降,过度聚焦单一架构或错失重大突破,建议调高‘探索旋钮’并分享结果。

机器之心
7

AI视频杀出一匹“快乐黑马”:把Seedance 2.0挤下榜首,幕后团队成谜

4月7日深夜,AI评测平台公告Video Arena新增匿名视频模型HappyHorse - 1.0,48小时后积分登顶,超过Seedance 2.0。网友猜测其出自中国团队,有线索指向Sand.ai等联合团队或阿里淘天集团。实测表现有亮点,Elo评分合理性存疑。

DeepTech深科技
推荐文章8

近500页史上最全扩散模型修炼宝典,宋飏等人一书覆盖三大主流视角

宋飏等人所著《The Principles of Diffusion Models》共460多页,系统梳理扩散模型发展脉络与核心思想,以统一数学框架串联多种视角,是研究者参考资料与初学者入门读物。

机器之心