图像到视频」共找到 3229 篇相关文章

推荐文章8

WaveSpeedAI 成泽毅:AI Infra 本来就是一门能挣钱的生意

WaveSpeedAI成泽毅本在大厂做Infra,后创业。他先在社区验证技术价值,创业首日就定全球化策略。WaveSpeedAI团队小而灵活,用利他思维合作,在视频生成领域降成本,验证了推理基建有市场。

Founder Park
开源动态8

可能是目前效果最好的开源生图模型,混元生图3.0来了

腾讯混元发布并开源原生多模态生图模型混元图像3.0,参数规模80B,是参数量最大的开源生图模型,也是首个开源工业级原生多模态生图模型,效果对标业界头部闭源模型。文中介绍其技术方案、测评效果等。

量子位
新闻资讯7

The Batch: 938 | Gemini 的音乐生成器

Google将音乐生成器Lyria 3加入Gemini和YouTube,它接收文本或图像生成30秒音频,支持多语言歌词。在质量和遵循提示上优于前身,采取版权保护措施,对特定用户免费或提供高额度使用。

DeeplearningAI
产品应用7

我复刻了 Claude 刚发布的生成式 UI 交互!

Anthropic在Claude上线基于生成式UI的新交互,作者复刻该功能Code Pilot。介绍其多种玩法,如数据分析、制作小工具等,还阐述实现过程与体验打磨细节,保证生成式UI视觉稳定。

歸藏的AI工具箱
推荐文章8

【教程】一口气教你用AI做出被数千名用户夸夸的UI设计

作者分享用AI做UI设计经验,先介绍用Claude Code等工具做出‘还可以’设计的方法,又阐述从‘还可以’‘被用户夸’的关键是定制图标,还给出具体工作流及方法有效的原因。

花叔
算法论文8

EMNLP2025 | 解耦视觉与推理,港大探索视觉语言模型"眼智分离"新范式

当前大视觉语言模型处理复杂推理任务时,常过分依赖语言知识,忽视图像关键信息。港大等团队提出ProReason框架,其蒸馏的ProReason - VL和ProReason - Q3模型性能提升显著,为LVLMs发展提供方向。

深度学习自然语言处理
产品应用7

再也不怕面瘫脸!YouTube黑科技:AI帮你「永久微笑」,连僵尸都咧嘴笑

YouTube在Shorts相机里实现AI实时「重绘」人脸,效果自然。它通过知识蒸馏将大模型「瘦身」成小模型,用迭代蒸馏打磨细节,PTI保证身份特征,MediaPipe搭建推理管道,还将拓展视频生成功能。

新智元
产品应用8

抖音+Claude Code=?马斯克都要转发的产品!一句话,就能做一个中国风福尔摩斯游戏!

Loopit被称为‘AI编程版的抖音’,用户说句话就能做互动内容,如解谜游戏等。它让编程像拍视频一样成消费品,有创作和社区,结合抖音轻量与游戏互动感,粘性更高。

AI产品自由
推荐文章7

网站GEO技术端优化指南:案例+工具+免费检查清单【转推】

文章指出当前处于传统搜索AI搜索转型期,Google仍是主流。介绍Google和ChatGPT流程差异,给出抓取、索引、曝光优化建议,还列了该做与不该做之事,并有免费检查清单。

白杨SEO优化教程
算法论文8

X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习

年初 DeepSeek - R1带火大模型强化学习,GRPO成常见RL算法,但训练成本高。腾讯优图论文提出Training - Free GRPO,将GRPO训练范式迁移上下文学习,成本低、泛化好,已开源。

机器之心