「图像处理」共找到 1383 篇相关文章
李飞飞团队新作:简单调整生成顺序,大幅提升像素级图像生成质量
长期以来,AI生图面临潜空间模型细节损耗、像素空间模型结构混乱速度慢的矛盾。李飞飞团队最新论文提出Latent Forcing方法,通过重排生成轨迹,让像素扩散模型找回效率并刷新SOTA。
40.9K Star 数据可视化神器!Json数据处理领域的“瑞士军刀”!
在数据驱动场景中,解析复杂嵌套JSON结构费时费力。GitHub上标星40.9K的开源工具JSONCrack,能将JSON数据可视化为交互式节点图,还有转换、格式化等功能,使用简单,应用场景广。
Gemini CLI 重磅更新:现已支持音视频处理,并带来多项体验升级
Gemini CLI 迎来重磅更新,带来多项改进。新增音视频输入(暂未正式开启)、增强 Markdown 功能,集成 VSCodium 和 Neovim,技术栈升级至 Ink 6 和 React 19,还有主题更新、隐私管理等优化。
阿里Qwen-Image-2.0图像生成与编辑巅峰汇合,超真实、超强图文结合
阿里Qwen - Image - 2.0将生图与编辑能力合二为一。它支持长指令,能精准渲染大量文字,引入物理逻辑让文字呈现真实质感,在生图和编辑上对语义理解和画面重构能力强。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
不看后悔!GitHub 开源 MultiTalk .8k star 强大的人语音+图像绑定项目
MultiTalk 是 MeiGen‑AI 开发的开源框架,可从音频、图片和提示语生成多人对话视频。它解决传统视频制作痛点,功能亮点多,技术优势明显,应用场景广,与同类项目对比表现突出。
DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!
4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。
BigQuery 新功能:SQL 直调 17 万 + AI 模型,3800 万行数据处理成本仅 2 美元
Google为BigQuery推出面向开源模型的第三方生成式AI推理功能,允许数据团队用SQL语句部署运行Hugging Face或Vertex AI Model Garden的模型,消除对独立ML基础设施的需求,解决数据团队痛点。
1吨旧手机能提取约200克黄金?你家的闲置手机可以这样处理→
我国年均产生废旧手机超4亿部,回收率低,因回收价低、信息安全顾虑,大量闲置。但旧手机资源回收价值高,“以旧换新”政策和技术升级正推动回收产业发展,打消消费者顾虑。
Google 推出了免费 Vibe Coding 工具,一键集成聊天、视频、图像AI,真的很氛围。
谷歌推出免费 Vibe Coding 工具,集成多种 AI 功能。谷歌 AI Studio 的 Built 模式更新,能混合匹配 AI 功能,自动连接模型和 API。用户无需了解 API 文档,可快速做出 MVP,谷歌 AI API 免费(限速)。