「多尺度生成」共找到 5656 篇相关文章
AdaGen: 让图像生成模型学会自适应策略
当前主流图像生成模型多步策略依赖手工静态调度规则,存在需大量调参、无法适配样本特性的问题。本文提出AdaGen框架,通过强化学习训练策略网络,在四大生成范式上实现性能提升与效率优化。
实时交互式长视频生成
文章提出用于实时交互式长视频生成的帧级自回归框架 LongLive,解决了长视频生成在效率和质量方面的挑战,具备长视频生成、实时推理、高效微调等亮点,还给出安装、推理、训练等步骤。
OpenAI点赞转发的冠军项目,背后藏着一个国人3D生成团队
近日,iOS产品StoryWorld获OpenAI Codex Hackathon冠军,其核心3D资产生成用了DeemosTech的Hyper3D Rodin。从黑客松到英伟达工程场景,3D生成重稳定性等特性。Hyper3D团队技术强,发布编辑功能,推动3D生成走向可控。
Tool-Star:赋予大模型结合多工具推理的能力
文章提出Tool - Star框架,旨在解决大模型多工具协作推理难题。它从数据端到训练流程优化,让模型调用多种工具,在复杂计算和知识型推理任务表现卓越,还探讨了未来多模态及多工具扩展方向。
腾讯开源Stand-In!轻量级身份保留视频生成新突破
生成符合指定身份的高保真视频挑战大,现有方法依赖大参数且兼容性不足。腾讯开源轻量级、即插即用的Stand - In框架,在身份保留文本生成视频任务中性能先进,兼容性强,有广阔应用潜力。
Google发布"Nano Banana"图像生成模型,号称全球第一
Google推出新图像生成和编辑功能,社区称其为‘Nano Banana’,号称‘世界第一’且免费开放。它有风格转换、背景编辑等亮点,用户反馈整体积极,但也存在API限制等问题,与对手有差距也有优势。
推理速度飙升5倍,苹果提出全新Multi-Token生成框架!
自回归语言模型逐词生成文本拖慢推理速度、限制并行能力。Apple提出全新框架,挖掘其对未来词元“先验知识”,通过多项技术并行预测多词元,微调预训练模型可显著提速且不损输出质量。
游戏研发中的 AI 转型:网易多 Agent 系统与知识工程实践
本文整理自网易游戏高级技术经理林香鑫分享,介绍大模型在游戏研发落地实践。团队用代码知识谱图、多 agent RAG 召回等技术打造超级助手,在多业务场景落地,推动内部 AI 生成代码覆盖率提升。
Wan 2.6 发布,可以参考视频进行角色扮演 & 终于有积分了:每天 150
Wan 2.6发布,积分从每天10个提升到150个。更新了主演、多镜头叙事、图像生成等新功能,如可将参考视频角色放入新场景,简单提示自动生成多镜头叙事视频等。
Gamma完美开源平替,输入主题一键生成专业PPT,配图排版全自动!
做PPT耗时耗力,现有AI驱动PPT生成工具多为闭源SaaS服务。GitHub上的开源项目presentation-ai是Gamma的开源平替,输入主题可自动生成PPT,功能丰富,还给出安装部署步骤和使用场景。