图像驱动」共找到 1037 篇相关文章

推荐文章7

5Y View|欢迎来到评测时代

强化学习推动AI突破,模型将刷爆既有评测,AI实验室面临评测饥荒。构建评测与RL环境是利用人类时间的高效方式,不同领域有不同验证方式,Mercor已率先拓展RL数据边界。

五源资本 5Y Capital
开源动态7

狂揽15.9K star!!Win系统居然还有开源替代版,牛逼啊~

开源君分享开源项目`ReactOS`,它类似Windows,目标是与NT系列无缝兼容,可直接运行Windows软件和驱动。该项目始于1996年,在Github获15.9K star,有轻量、兼容等特点,安装简单。

开源先锋
开源动态8

智源新出OmniGen2开源神器,一键解锁AI绘图「哆啦 A 梦」任意门

2024年9月智源研究院发布统一图像生成模型OmniGen,获社区好评。近期OmniGen升级为OmniGen2,增强多方面能力且全面开源。它采用新架构与策略,有反思机制,玩法丰富,还推出新基准优化部署。

机器之心
开源动态8

爬虫界“瑞士军刀”!开源高性能爬虫工具,实施进度监控、全栈SDK支持、n8n深度集成!

在AI驱动的数据时代,WaterCrawl是基于Python和Scrapy的开源网页爬虫工具,专为大规模数据提取和LLM优化设计,支持多语言内容抓取、实时进度监控和深度AI平台集成,优势显著。

开源星探
开源动态7

5.8k Star 基于LangGraph的Multi-Agents炒股框架,7种Agent形成金融交易闭环

TradingAgents是模拟真实交易公司运作的多智能体交易框架,用LangGraph构建,有灵活性与模块化特点。由7种LLM驱动的专业智能体协同评估市场、制定决策,还介绍了架构和实战操作。

CourseAI
产品应用7

SkyReels-Audio让嘴型和音频完美匹配不再难

音频驱动的动态人脸生成研究较少,昆仑万维提出SkyReels - Audio框架,基于预训练视频扩散变换器构建,支持无限长度视频生成与编辑,采用混合课程学习等策略,保障视频视觉保真度和时间一致性。

带你学AI
算法论文8

用大模型检测工业品异常,复旦腾讯优图新算法入选CVPR 2025

AI模型用于工业异常检测获新SOTA,相关论文中稿CVPR 2025。复旦大学、腾讯优图实验室等机构研究人员设计基于扩散模型的少样本异常图像生成新模型DualAnoDiff,实验显示其性能更优。

量子位
新闻资讯7

CVPR 2025 Tutorial:从视频生成到世界模型 | MMLab@NTU团队&快手可灵等联合呈现

图像生成普及,视频生成也有高质量发展,可灵、Sora等模型不断拓宽边界。CVPR 2025 Tutorial将探讨视频生成能否成世界模型桥梁、具身智能核心能力等问题,汇聚一线研究者分享。

量子位
算法论文7

首个多人对话视频生成框架MultiTalk,角色有表情还能互动

现有音频驱动人体动画方法多聚焦单人,处理多音频流能力弱、指令跟随有局限。中山大学提出多人对话视频生成新框架MultiTalk,介绍了技术原理,演示效果显示其指令跟随能力强、伪影少。

带你学AI
算法论文8

中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考

上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。

机器之心