音视频生成模型」共找到 8907 篇相关文章

产品应用8

Qwen-lmage-Layered:图片分层 指哪改哪

全新图像生成模型Qwen-lmage-Layered采用自研架构,将图片“拆解”成多个图层,各图层可独立操作。其提出新编辑思路,有RGBA - VAE等亮点,支持灵活迭代分解,能实现精准高效的图像编辑。

通义千问Qwen
开源动态8

一张图片+ 一条音频,照片开口说话唱歌,多角色、情绪控制都拿捏了。

腾讯混元联合腾讯音乐推出 HunyuanVideo - Avatar 模型,上传照片配音频就能生成动态视频。支持多风格角色、情绪控制和多角色对话,单角色模式已开源,技术有创新,在多数据集表现优。

AI进修生
产品应用7

MMX-CLI给AI Agent装上七种感官,内容创作更方便

MiniMax发布的MMX - CLI命令行工具,给AI Agent装上七种新感官,具备图像生成视频创作等能力,可一站式解决内容创作问题。它安装使用简单,功能多,还能集成到现有工作流,不过采用按量付费。

AI工程化
推荐文章8

WaveSpeedAI 成泽毅:AI Infra 本来就是一门能挣钱的生意

WaveSpeedAI成泽毅本在大厂做Infra,后创业。他先在社区验证技术价值,创业首日就定全球化策略。WaveSpeedAI团队小而灵活,用利他思维合作,在视频生成领域降成本,验证了推理基建有市场。

Founder Park
开源动态8

告别Transformer!北大、北邮、华为开源纯卷积DiC:3x3卷积实现SOTA性能,比DiT快5倍!

北大、北邮和华为研究提出纯卷积扩散模型 DiC,抛弃自注意力机制回归 3x3 卷积。它性能超 DiT,推理速度快 5 倍,证明精心设计的卷积网络在生成任务中也能表现卓越。

机器之心
开源动态8

刚刚,清华团队养出了一只「龙虾老师」!教育版OpenClaw震撼开源

清华教育学院与计算机系联合团队开源多智能体AI课堂OpenMAIC。它能一键生成交互式课程,AI老师语音授课、AI同学互动。经两年真实课堂验证,支持主流大模型,有望成教育版ClawHub。

新智元
推荐文章7

故事式

作者李继刚在好友丁锐启发下尝试「故事式」Prompt,即塑造含「欲望」与「阻力」的动力场让模型生成回复,还给出如「字典疯子」「探索者」等多个故事式Prompt示例供读者体验。

李继刚
新闻资讯7

AI助手Cici悄然霸榜海外,又是字节

AI智能助手领域有新玩家,字节跳动的Cici在多个国家应用商店霸榜,数月内下载量爆发式增长。它融合字节旗下技术,文本生成用到OpenAI、谷歌模型。同时,豆包在国内AI智能助手赛道全维度领先。

量子位
新闻资讯7

“Claude Code 这条路线错了”!元老级 AI 大师 Jeremy Howard 开炮:马斯克和 Dario 根本不懂现代软件工程

元老级 AI 大师 Jeremy Howard 批评当下技术话题,称马斯克和 Dario 不懂现代软件工程。他认为大模型虽能生成代码,但难胜任软件工程,Claude Code 未突破现有技术,还会削弱开发者对系统的理解。

InfoQ
算法论文8

登顶多模态推理榜MMMU!UCSD新方法超越GPT-5、Gemini

加州大学圣地亚哥分校团队开发的DreamPRM-1.5在MMMU测评榜夺冠,超越GPT-5、Gemini 2.5 Pro Deep-Think。它细化加权粒度到样本,有Instance Table和Instance Net架构,采用双层优化与生成式奖励模型

新智元