「多风格图像」共找到 4502 篇相关文章
解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换
视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。
GitHub Trending 榜一的开源 Cowork 来了!4天4.5K星,首个多智能体工作流应用!
开源项目Eigent冲上GitHub Trending榜首,4天获4.5K+ Star。它是全球首个多智能体工作流桌面应用,完全开源、支持本地模型,有多种智能体工作流,具备本地优先、并行工作流等特性,提供三种使用模式。
GPT-4o图像生成的「核燃料」找到了!万字长文拆解潜在变量,网友:原来AI在另一个维度作画
上月,GPT - 4o图像生成功能爆火。Sander Dielman在博客中探讨生成模型利用潜在空间提高效率和质量,将潜在变量比作「数据精髓」,深入对比多种模型,还介绍训练方法、损失函数等,兼具理论深度与直观洞察。
360开源高质量图文对齐数据集!收纳1200万张图像+1000万组细粒度负样本,让模型告别“图文不符”
360人工智能研究团队的冷大炜博士团队开源FineHARD高质量图文对齐数据集,包含1200万张图像、4000万个边界框及对应描述、1000万组细粒度难负样本,能提升模型图文对齐能力,还介绍了构建方法、分析及应用前景。
视频世界模型跑长序列不「崩」了!用光流约束+历史记忆+多步训练,让动态场景稳如磐石
现有视频世界模型在长时间交互中易出现运动不合理与场景崩坏问题,核心原因是误差累积。MagicWorld提出面向长时稳定性的交互式建模框架,通过光流约束、历史缓存检索和多步聚合训练,有效缓解误差累积。
银河通用X清华大学发布业内首款开源人形机器人全身遥操系统OpenWBT,支持多机型、跨虚实,小时内可轻松部署
银河通用与清华大学合作发布全开源人形机器人全身遥操作系统OpenWBT,新手小时内可部署。该系统有极简部署、多机型跨平台、兼顾虚实遥操三大亮点,背后技术解决了sim2real迁移难题。
图像界的DeepSeek!12B参数对标GPT-4o,5秒出图,消费级硬件就能玩转编辑生成
Black Forest Labs开源旗舰图像模型FLUX.1 Kontext[dev],专为图像编辑打造,能在消费级芯片运行。12B参数少、推理快,性能媲美闭源模型。有诸多特点,经优化训练,在KontextBench基准表现优。
3D重建的惊人进展:多所世界名校联合发布论文,告诉你AI在3D世界的研究现状
多所世界名校联合发布调查研究论文,回顾用于3D重建和视图合成的前馈技术并分类,研究关键任务及应用。前馈模型打破每场景优化魔咒,带来速度和泛化能力的提升,解锁新应用,但也面临挑战。
【GitHub 10.9k star】DeepCode:把论文和需求文档“一键变代码”的多智能体开发神器,真能干掉手写样板?
DeepCode 是香港大学开源的多智能体开发平台,支持将论文、需求文档等转化为生产级代码。它能解决论文复现、原型开发等痛点,有多项特色功能,在性能对比中领先,适用于多类场景。
振臂一挥,大半个具身机器人圈都来了!智源研究院:别藏了,谁贡献数据多,谁的大脑就更好用
2025智源具身智能Open Day上,智源研究院院长邀厂商共享数据,称谁家贡献多,具身大脑在其机器人上更好用。智源无商业包袱,开源数据、统一评测,布局具身大小脑体系,欲做具身智能“安卓”。