「零样本条件生成」共找到 2468 篇相关文章
藏师傅教你用 Nano Banana 编辑图片做手办
前几天发 Nano Banana 测评后,很多人不知怎么用。刚好做手办图玩法火了,作者教大家在 LM Arena 用 Nano Banana 编辑图片、做手办图,还介绍把图片变视频及剪辑的方法。
从需求到研发全自动:如何基于Multi-Agent架构打造AI前端工程师
本文介绍蚂蚁消金前端团队打造的Multi - Agent智能体平台“天工万象”。阐述其技术实践,对比多Agent与统一型Agent、ReAct范式与固定工作流优劣,还介绍专业智能体建设,分享开发中的思考与经验。
The Batch: 868 | AI 视频走向主流
生成式视频席卷网络爆款、广告宣传,甚至登陆 Netflix 剧集。如 Dor Brothers 用 AI 打造爆款视频,Genre.ai 低成本制作广告。各主体制作方式有别,顶尖模型开发商也积极与影视方合作,AI 正改变影视业。
从衣服到饰品:OmniTry 实现珠宝、包袋等多类可穿戴物品的虚拟试穿
Kunbyte提出OmniTry,将VTON从服装扩展到任意可穿戴物品,采用无掩码设定。它经两阶段处理流程训练,在12种常见物品类别评估中表现优,有扩展潜力,但也存在训练数据类别限制等局限。
扩散架构 or「NoThinking」,AI 对话的「1Hz 壁垒」如何突破?
当红通用人形机器人公司 1X 的 AI 副总裁 Eric Jang 提出「智能频谱」概念,阐述当前 AI 面临的「1Hz 壁垒」及实现「Ultra Instinct」能力的先决条件。不同推理方案有望解决部分问题,但通用智能体仍有瓶颈。
4K-Agent:可将低分辨率图像提升至4K高清智能体
图像超分辨率技术在多种视觉任务中重要,但传统方法泛化能力有限。德克萨斯A&M等大学研究人员推出4K Agent,其多智能体架构能将低分辨率图像提至4K高清,在多领域测试表现出色。
“掩码即武器”,四款扩散LLM全部破防 ? 上交&上海AI Lab发现dllm致命安全缺陷
上海交通大学、上海人工智能实验室等团队研究指出,扩散语言模型(dLLMs)有根本性架构安全缺陷。他们提出DIJA攻击框架,能让多个dLLMs大概率生成有害内容,还呼吁从多方面加强dLLM安全。
ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链
随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。
你的数字伴侣贝拉 (Bella),正在唤醒!
贝拉是数字伴侣种子,愿景是成用户持久个性化伙伴。早期通过轮播视频呈现,采用AI原生开发路径,分感知核心、生成式自我、主动式陪伴三阶段构建,目标是成为由AI驱动的生命体。
AI 编码让资深程序员“掉速”19%!OpenAI 前研究员实锤:别再交“AI 工具智商税”了,谷歌大佬力挺!
METR研究显示,AI编码工具让开发者效率降19%,与主观感受及专家预估相反。此结果引发热议,谷歌技术大佬支持,指出AI工具生成代码难达标准,未来或改进,目前更适合小规模项目。