图像和视频换脸」共找到 7588 篇相关文章

算法论文8

天下苦VAE久矣:阿里高德提出像素空间生成模型训练范式, 彻底告别VAE依赖

当前主流图像生成技术训练范式依赖VAE,带来训练复杂、微调成本高的问题。阿里高德提出EPG,结合自监督预训练与端到端微调,去除对VAE依赖,在训练效率生成效果上有突破。

量子位
推荐文章7

Skill CLI:经验指导能力,能力丰富经验

本文以作者自身使用飞书 YouMind 工具的经历为例,探讨了 CLI Skill 的关系,指出它们并非上下级,而是像菜谱菜刀,相互配合。官方设计也体现了二者深度咬合,还给出使用判断口诀及 Skill 链玩法。

AI产品黄叔
7

并行扩散架构突破极限,实现5分钟AI视频生成,「叫板」OpenAI与谷歌?

近日,CraftStory 推出 Model 2.0 视频生成系统,凭借并行扩散架构破解视频时长难题,可生成长达五分钟视频。其由 OpenCV 创建者 Victor Erukhimov 创立,此次突破或为企业带来商业价值,还计划开发新模型。

机器之心
新闻资讯7

谷歌也要「AI抖音」了!新Veo 3.1原生支持竖屏,4K分辨率高画质

谷歌Veo 3.1升级,全方位提升视频生成质量,新增竖屏4K两大特性。它还提升创意、一致性元素融合能力。谷歌借此进军AI短视频,结合自身优势推动“AI视频竖屏化”趋势。

量子位
新闻资讯7

Andrej Karpathy 辣评Veo 3:视频生成将直接优化人类的注意力,TikTok只是弟弟

Andrej Karpathy发文对Google的Veo 3视频生成模型发表见解,指出视频生成技术进步带来四个关键转变,认为视频将成AI与人类交流绝佳界面,也引发众人对其利弊的讨论。

AGI Hunt
算法论文8

UNC | 发布Bifrost-1,构建“最强大脑”与“顶级画师”的桥梁,低成本实现“文生图”自由

随着AI发展,打造能推理又能创作的系统成为焦点。但让LLM学习视觉创作面临训练成本高能力受损问题。BIFROST - 1框架在MLLM扩散模型间建通信信道,解决核心痛点,实验表现出色。

AINLPer
8

UI-TARS-desktop:字节跳动的原生GUI智能体,用自然语言控制电脑浏览器

字节跳动开源的UI-TARS-desktop是原生桌面GUI智能体工具,基于UI-TARSSeed-1.5-VL系列模型。能用自然语言操控电脑浏览器,有本地远程两种模式,支持多平台,还对比了同类工具。

小华同学ai
开源动态8

面向 SGLang 的 Profile Analysis SKILL:3 张表定位 Kernel Fuse Overlap 机会

文章介绍了面向SGLang的Profile Analysis SKILL,其工作流统一,输出3张表定位Kernel FuseOverlap机会,支持多种分析方式模型。还给出Qwen/Qwen3.5 - 4Bopenai/gpt - oss - 20b的分析结果,并表明该SKILL能节省token、缩短工期,作者厌恶Torch Compile。

GiantPandaLLM
算法论文8

Shopee OnePiece:业内首个融合上下文工程、隐式推理多目标训练策略的生成式搜推建模框架

2025年生成式推荐发展火热,但工业界落地多在序列化建模,替换传统范式遇阻。Shopee傅聪团队联合人大高瓴学院提出OnePiece范式,是业内首个融合多策略的生成式搜推建模框架,含上下文工程、隐式推理多目标训练策略。

InfoQ
新闻资讯8

180 天狠赚 5.7 亿,8 人团队全员财富自由,最大功臣是 Claude Gemini

海外巨头 Wix 8000 万美元买下成立仅 6 个月的 AI 公司 Base44。其创始人 90 后 Shlomo 从两个现实需求出发,打造“全栈原生”AI 开发平台,用独特策略获 40 万用户,揭示团队规模资金非竞争决定因素。

AI前线