多尺度生成」共找到 5656 篇相关文章

开源动态8

社区供稿 | VibeVoice实现90分钟、角色播客生成,拓展语音合成新边界

微软亚洲研究院提出全新语音生成模型 VibeVoice,采用 next - token diffusion 机制,能将文字脚本转为最长 90 分钟、最 4 人对话的高质量播客音频,在方面有显著优势,未来潜力大。

Hugging Face
算法论文8

一键实现PPT演讲自由!「解说音频+视频」同步生成,效果逼近真人

澳大利亚与英国研究人员提出文档到演示视频生成任务,推出PresentAgent系统。它能将长文档转为带语音和同步幻灯片的视频,流程可控且适应领域。实验显示其生成视频接近人类表现,还设计了双路径评估策略。

新智元
开源动态8

国产王炸!上海AI Lab开源Lumina-DiMOO,开创模态理解与生成新范式

上海人工智能实验室等机构推出模态生成与理解统一模型Lumina - DiMOO,采用全离散扩散架构。它解决传统模态架构问题,有全离散扩散建模等四大创新,性能在基准测试中领先,应用前景广。

AIGC开放社区
算法论文8

简单即强大:全新生成模型「离散分布网络DDN」是如何做到原理简单,性质独特?

本文作者杨磊介绍全新生成模型离散分布网络DDN,它建模目标分布机制简洁独特,有零样本条件生成等特性。文中详述其原理、网络结构、损失函数,还展示实验效果,最后给出未来研究方向。

机器之心
算法论文8

西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026

AI 视频生成目前存在长视频稳定性问题,西湖大学张驰团队提出 《Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction》。研究表明 FreeLOC 方法能提升长视频生成质量,且具跨模型通用性,还揭示了问题机制,降低算力成本。

AI科技评论
新闻资讯7

Anthropic发布Agent协作模式指南:5种架构与适用场景

当单个AI Agent无法完成任务时,Agent系统就派上了用场。Anthropic最新发布的指南给出了五种经过验证的模式,包括生成 - 验证模式、编排 - 子代理模式等,并介绍了适用场景和陷阱。

AI工程化
产品应用7

颠覆金融分析!智能体AI股票分析师震撼登场!

智能体AI股票分析师登场,由股票分析与报告撰写两智能体组成,通过CrewAI框架协作。用Streamlit构建界面,结合YFinance等获取数据,可30秒内生成含买卖建议报告。

GitHubStore
产品应用7

Claude Code 学习最佳实践:NotebookLM 生成全套学习视频+卡片+测试题

文章介绍用NotebookLM学习Claude Code的最佳实践。有人将36篇Claude Code资料“喂”给它,生成含音视频的学习资料库。NotebookLM能种形式输出,支持类型输入,值得纳入日常工作流。

AI进修生
开源动态8

终于开源升级OmniGen2,统一模态图像生成模型,真的惊艳。

OmniGen2是强大的开源统一模态图像生成模型,针对文本和图像模态构建独立解码路径,运用未共享参数。新架构提升处理效率和质量,在图像编辑等任务表现出色,还有技术特点。

开源AI项目落地
产品应用7

抢先体验GenFlow2.0:未来Agent协作的理想形态

作者在百度邀测会抢先体验Genflow 2.0,用其解决小学教改信息查询问题,还让它生成创意图片。它得益于“沧舟OS”,有流畅、并发且跨模态能力,架构全自研,测试版亮点,值得期待8月正式上线。

AI产品黄叔