图像定制化」共找到 1345 篇相关文章

开源动态8

阿里通义新年礼物:开源最强Qwen-Image-2512版本告别AI塑料感与文字乱码

通义万相新年前发布Qwen - Image - 2512版本。它是开源界最强文生图模型,在AI Arena盲测中表现出色。能消除AI塑料感,攻克文字渲染难题,在还原真实世界和重构视觉元素逻辑排版上有显著提升。

AIGC开放社区
新闻资讯7

十万美元的机械狗,正在“排泄”你的肖像!

迈阿密巴塞尔艺术展上,售价十万美元的《普通动物》由三只戴扎克伯格、马斯克和安迪·沃霍尔面具的机械狗组成,内置摄像头捕捉观众与环境,AI生成图像后“排泄”出实体作品,引发不同评价。

搜狐看展
产品应用8

阿里电影级视频模型万相2.6系列上线,功能比Sora2还全,人人都能当导演

12月16日,阿里发布通义万相2.6系列模型,5款新模型同时上线,覆盖图像到视频多环节。它是国内首个支持角色扮演的视频模型,功能比Sora2全,已上线阿里云百炼和万相官网。

AI前线
算法论文7

预测下一个像素还需要几年?谷歌:五年够了

谷歌DeepMind研究者分析下一像素预测在图像识别与生成任务中的扩展特性。实验显示其扩展趋势与文本类似但效率低,最优策略因任务和分辨率而异,预计未来五年逐像素建模可行。

机器之心
推荐文章7

Vibe Coding 产品最大的错觉,是以为自己真的有护城河

Base44创始人Maor Shlomo认为Vibe Coding工具易被复制,技术护城河难寻。他指出真正的护城河是“垂直整合”,构建全栈平台很关键。还谈到市场竞争、软件发展趋势、公司策略等多方面内容。

Founder Park
开源动态8

2M大小模型定义表格理解极限,清华大学崔鹏团队开源LimiX-2M

大语言模型在结构表格数据处理上表现不佳,清华大学崔鹏团队开源的 LimiX-2M 模型,仅 2M 参数,却能同时支持分类、回归等任务,性能超越经典模型,且训练、运行成本低,科研友好。

机器之心
新闻资讯7

AI算力大战打到太空!英伟达前脚H100入轨,谷歌TPU后脚上天,中国玩家笑而不语

英伟达和谷歌在太空算力布局上竞争激烈,英伟达H100已入轨,谷歌TPU预计2027年初上天,二者都想建吉瓦级数据中心。太空部署有成本、散热等优势,但也有工程挑战,而中国之江实验室星座已商用。

量子位
开源动态8

开源即登榜!登顶全球前十AI编程智能体,UCL初创团队开源Prometheus

UCL初创团队EuniAI开源AI软件智能体Prometheus,在SWE - bench Verified上Pass@1达71.2%,成绩入官方主榜。它有图结构推理设计,能理解代码,成本低,官网有Demo展示其工程能力。

新智元
开源动态8

多模型共享 GPU 内存,Berkeley 开源新工具

GPU内存利用率低是大模型部署痛点,伯克利Sky Computing Lab团队开源kvcached工具,通过虚拟技术让多模型共享显存。它引入虚拟内存概念,按需分配,测试显示能提升效率,安装简单、兼容性好。

AI工程化
算法论文8

拒绝“熵崩塌”和“熵爆炸”!这项研究让大模型学会“精确探索”,推理成绩飙升

2024年以来,大模型在推理任务上进展显著,得益于RLVR方法,但面临“熵困境”。研究团队提出选择性熵正则方法(SIREN),通过三重机制精准调控探索行为,实验证明其能提升模型推理成绩。

量子位