视觉外观编辑」共找到 874 篇相关文章

算法论文8

多模态BUG修复新SOTA:慕尼黑工大GUIRepair登上SWE-bench Multimodal榜单第一

自动化修复软件缺陷是长期目标,多模态问题修复受关注。慕尼黑工业大学团队提出GUIRepair,融合APR与GUI Testing知识,登上SWE - bench Multimodal榜单第一,为多模态软件自动修复开辟新路。

机器之心
开源动态8

字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。

字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。

GitHubStore
开源动态7

爆火开源AI画布,真正可落地的手写AI黑板

文章推荐开源AI画布PenEcho,它是个超智能黑板,适合学习场景,让手写与AI共生。能理解内容及空间关系,把回答放回画布,支持多模型,还具备多种功能。

开源AI项目落地
开源动态8

南京大学开源SteadyDancer模型实现完美动作迁移,首帧保留彻底解决身份漂移难题

南京大学、腾讯PCG与上海人工智能实验室联合推出SteadyDancer,这是首个基于Image-to-Video范式并严格实现首帧保留的开源人像动画框架,解决了传统方法身份漂移难题,在多方面表现优异。

AIGC开放社区
开源动态8

NVIDIA开源“Banana”级黑科技!会懂物理、理解时间的图像编辑模型!

继谷歌Banana后,英伟达开源物理级图像编辑模型ChronoEdit - 14B,被称‘NVIDIA版的Banana’。它有‘时间观念’和‘物理常识’,能按描述生成符合物理规律图像,适用于多领域。

开源星探
算法论文8

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。

机器之心
开源动态7

Lucide 1.0 发布,移除品牌图标,并缩减数百万个项目的包大小

Lucide 1.0 发布,它是开源图标工具包,是 Feather Icons 分支。此次移除品牌图标,缩减 lucide - react 包大小,还引入上下文提供程序等改进,社区反响有赞有弹。

InfoQ
开源动态7

专为终端设计 ,轻量快速,GB 大文件都秒开!

开源君发现一款基于 Rust 的终端文本编辑器 `Fresh`,目标是轻量、快速、功能强大,支持多平台,有7.1k+ star。它上手0门槛、轻量快速,有代码友好功能和丰富生产力工具,还支持插件扩展,提供多渠道安装方式。

开源先锋
产品应用7

这个 4o 矢量插画提示词效果太好了

该 40 矢量插画提示词效果出色,适合张扬的产品主题插画,色彩一致、线条粗,便于转换成 SVG,还给出了具体提示词内容。

歸藏的AI工具箱
产品应用8

啊?豆包居然也开始卷AI编程了?

作者体验发现豆包更新了“应用创造1.0”标识的AI编程功能。该功能不仅能生成代码,还能可视化修改网页结果,用户操作轻松,降低了AI编程门槛,体验远超其他同类产品。

数字生命卡兹克