结构化图像生成」共找到 2827 篇相关文章

算法论文8

无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention

高质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。

机器之心
开源动态8

谷歌AI Agent刚开源!多任务智能体+MCP+谷歌搜索,狂揽9000颗星

今天凌晨,谷歌在官网开源AI Agent框架Gemini CLI,将Gemini大模型融入终端。它能调用视频和图像模型,集成MCP、谷歌搜索等功能,还集成超强编码助手,刚开源就在Github超9000颗星。

AIGC开放社区
推荐文章8

揭秘千卡 GPU 集群如何高效训练多模态大模型:vivo AI 团队实战经验分享|AICon

在 InfoQ 举办的 AICon 大会上,vivo AI 架构师王兆雄分享多模态大模型训练经验。介绍了 LLaVA 和 DiT 模型训练挑战,从数据处理、模型计算等方面提出优化策略,还展望 AI Infra 未来发展方向。

AI前线
开源动态8

统一20+多智能体方法,MASLab震撼发布

由十机构联合推出的 MASLab,带来大模型多智能体系统代码库,统一 20+主流 MAS 方法。有方法全、评估准、结构清晰特性,经大量实验刻画性能图谱,还提出新方法,且发起开源社区。

机器之心
新闻资讯8

灵初智能陈源培:一个 00 后的机器人之梦

00 后陈源培是灵初智能联创,本科土木工程专业,大二因比赛对机器人感兴趣。他研究灵巧手,参与开源项目,灵初发布相关模型。他认为强化学习对灵巧手重要,还谈了模型、创业、落地等看法。

AI科技评论
算法论文7

何恺明改进了谢赛宁的REPA:极大简化但性能依旧强悍

扩散生成模型在建模复杂数据分布表现出色,但与表征学习领域关联不大。谢赛宁团队提出REPA,不过较麻烦。何恺明团队提出Dispersive Loss,简化且性能强,无需预训练等,适用于多种模型。

机器之心
产品应用7

The Batch:831 | 机器翻译正在实践中发挥作用

人工智能为语言学习应用巨头 Duolingo 带来生产力提升,借助生成式 AI 构建 148 门课程,总量翻倍。其 AI 辅助课程构建法能快速转化多语种版本,还在评估多模型,不过此举也引发批评。

DeeplearningAI
新闻资讯8

AI时代UI已死?Karpathy称产品要给AI开后门,还分享了自己的AI编程心法

Andrej Karpathy指出,只有复杂UI、无脚本支持、基于不透明二进制格式的软件产品,在AI时代会被淘汰。他给出风险评估清单,还分享AI编程心法,探讨编程中‘验证鸿沟’问题。

AGI Hunt
开源动态8

一张图片+ 一条音频,照片开口说话唱歌,多角色、情绪控制都拿捏了。

腾讯混元联合腾讯音乐推出 HunyuanVideo - Avatar 模型,上传照片配音频就能生成动态视频。支持多风格角色、情绪控制和多角色对话,单角色模式已开源,技术有创新,在多数据集表现优。

AI进修生
开源动态8

2天1k多星!BAGEL横空出世:字节跳动发布全球首个多模态全能AI,开启智能新纪元!

字节跳动推出开源多模态基础模型BAGEL,有70亿活跃参数。它在多模态理解排行榜超顶尖开源模型,文本到图像质量与SD3媲美,还具备世界建模等能力,文中介绍其方法、特性及使用说明。

GitHubStore