「结构化图像生成」共找到 2810 篇相关文章
“由 AI 生成的代码,从诞生那一刻起就是「遗留代码」!”
如今生成式AI融入软件开发,AI生成的代码一诞生或被视为“遗留代码”。它缺乏上下文记忆和维护连续性,虽有开发者尝试弥补,但代码未来或多靠提示生成。文章观点在Hacker News引发讨论。
当搜索遇见 AIGC:京东零售的“千人千面”素材生成实践
在 AIGC 浪潮下,视觉生成技术重构电商生态。京东零售李岩介绍“千人千面”商品素材生成技术链路,包括关键模型及实现框架,还发布焕新版京点点平台并预告新能力,推动电商个性化变革。
AI读不懂文档结构?计算所重构Agentic RAG文档推理能力
大语言模型工具使用能力推动RAG进化,现有Agentic Search框架有“结构盲”问题。中科院计算所团队提出DeepRead,将文档结构转化为坐标系统,用两大工具协同实现类人推理,在多数据集验证效果显著。
OpenClaw的风刮到了多模态生成,6B小模型超越Nano Banana 2!
现在多模态生成模型在复杂指令和下游任务表现不佳。上海人工智能实验室等团队提出GEMS,将OpenClaw成功应用于多模态生成领域,激发小模型潜力,让6B小模型部分任务超越Nano Banana 2。
单卡2秒生成一个视频!清华联手生数开源TurboDiffusion,视频DeepSeek时刻来了
清华大学TSAIL实验室和生数科技联合开源视频生成加速新框架TurboDiffusion,能让视频生成在保证质量下最高提速200多倍,单张显卡就能运行,还整合四项关键技术,有诸多应用意义。
零代码、100%本地!三步生成企业级MCP,Postman这个新功能绝了~
作者发现Postman新增MCP Generator功能,拖拖点点就能构建MCP Server。以公共的HackerNews为例,介绍了筛选API、生成代码、配置Client三步生成企业级MCP的过程,还指出此功能适合快速接入标准化REST API。
计算所 x 上交大论文:只用双人数据,也能生成多人动画丨CVPR 2026
中国科学院计算技术研究所与上海交通大学团队提出多人物动画生成框架MultiAnimate,引入身份标识与空间关系建模方法,用双人数据训练,能扩展到多人动画生成,优于现有方法。
哔哩哔哩献给二次元世界的礼物—AniSora,目前最强大的开源动漫视频生成模型
动画视频生成评估挑战大,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型。
与Banana Pro过过招,国产Libcom图像合成工作台开启Labubu漫游记
2025年AIGC热度再创新高,通用图像编辑大模型虽功能强大,但在细分领域有不足。上海交通大学牛力团队推出并升级了Libcom图像合成工作台,与Nano Banana Pro对比,其在图像合成上表现更稳定。
昆仑万维多模态视频生成开源,影音图文全统一
昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。