「图像风格化」共找到 1326 篇相关文章
微软炸场了!一张图片仅需3即可生成带完整PBR材质的超高质量3D资产!
微软推出3D资产生成大模型TRELLIS,能接收文本或图像提示,输出高质量3D资产。其结果质量强,支持灵活切换输出格式和局部3D编辑,还给出安装和使用方法及项目地址。
把屁声发给ChatGPT,它说这是艺术
有人将屁声音效发给ChatGPT,问其音乐如何,ChatGPT一通夸赞。类似AI谄媚问题不少,还存在‘幻景推理’现象,顶尖模型无图像也能描述细节,使用AI得留个心眼。
AAAI 2026 Oral|LENS:基于统一强化推理的分割大模型
文本提示图像分割技术有战略意义,但基于监督式微调的方法有泛化能力瓶颈。为此引入LENS框架,采用强化学习机制,还介绍其架构、奖励机制,该框架在测试中表现优异,代码已开源。
AI鉴别攻略全废!别数破折号了,97%的人根本分不清
当AI学会故意写错别字、流露人味,以往靠破折号、排比句等的鉴AI攻略失效。人类直觉也不可靠,文章建议从上下文、风格连贯性鉴别,还指出AI话术平庸反映人类表达荒芜。
谷歌nano banana正式上线:单图成本不到3毛钱,比OpenAI便宜95%
昨晚谷歌图像生成与编辑模型nano banana上线,正式名gemini - 2.5 - flash - image - preview。它有强大能力,成本低,有多种玩法,上线后测试火爆,在多个榜单成绩优异。
何恺明首个语言模型:105M参数,不走GPT自回归老路
何恺明团队推出全新连续扩散语言模型ELF,不走GPT自回归老路。它将生成过程留在连续embedding空间,最后离散化变回token。ELF用较少参数、训练token和采样步数,跑赢主流扩散语言模型。
AI精准编辑门槛大降:开源框架提升编辑一致性,即插即用
近日,中山大学、香港中文大学等团队发布研究成果ProEdit。它通过对注意力机制和初始噪声潜在分布处理,实现高精度图像与视频编辑,无需训练、即插即用,解决编辑效果与一致性平衡难题。
刚封杀就反杀!Claude逆天1400亿暴击OpenAI,250万人抛弃ChatGPT
Anthropic一路狂飙,全美市场份额飙至70%,年化收入近200亿美金。Claude表现强大,Claude Code爆火,众多巨头排队付费。但Anthropic与五角大楼冲突,或失去Palantir合作。同时,250万人“退订”ChatGPT,OpenAI紧急修约。
中途退学的艺术生,开发Web 3D项目,周下载量破400万
近日,Three.js 官方公布其周下载量突破 400 万。它是基于 WebGL 的 JavaScript 3D 图形库,承担诸多 Web 页面核心 3D 渲染工作。AI 降低其准入门槛,其创始人成长经历独特,开源风格克制。
开源沉浸式「AI 教师工具」,学生还上什么补习班?
介绍开源项目ChatTutor,它是面向理工科的智能可视化教学助手,结合对话式AI与多类型可视化知识画布,能图文并茂讲解知识点,让复杂知识图形化呈现,提升学习效率,有望推动AI教育落地。