多主体视频生成」共找到 2695 篇相关文章

算法论文8

何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升

何恺明最新论文研究扩散模型与表征学习的联系,提出Dispersive Loss正则化方法。它无需正样本对,有高通用性、低计算开销等优势,在多模型测试中提升了生成质量,在其他任务也有潜力。

量子位
算法论文8

YC总裁转发、登顶Hacker News:SkillsBench揭开Agent技能扩展的残酷真相

近日论文《SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks》引发海外AI社区关注。研究聚合47150个Skills,经严格筛选评估,揭示人工构建Skills效果好、AI自生成无效等核心发现,为AI研发指明路径。

机器之心
新闻资讯7

清华辍学、斯坦福睡地板,华人小哥用AI社交挑战Meta,融资数千万美元

来自中国的小哥Brandon Chen打造AI原生即时通讯工具Intent,已获数千万美元融资。它结合微信聊天与大模型自动执行功能,如处理图片、规划旅行、生成购物清单等,带来全新聊天体验。

机器之心
推荐文章7

一文带你彻底理解AIGC、Agent、MCP的概念和关系

本文为非AI开发者科普AIGC、Agent、MCP概念和关系。AIGC用AI生成内容;Agent可自主决策调用工具;MCP是Anthropic开源协议,降低模型与工具集成成本,获大厂支持。

腾讯技术工程
新闻资讯8

Gemini负责人爆料!多模态统一token表示,视觉至关重要

Gemini模型行为产品负责人Ani Baddepudi与谷歌AI Studio产品负责人探讨Gemini多模态技术,涉及设计理念、应用及发展方向。指出多模态对构建AGI重要,还介绍Gemini 2.5视频理解亮点与‘万物皆视觉’理念。

量子位
推荐文章7

LLM学习笔记:最好的学习方法是带着问题去寻找答案

文章总结拓展Andrej Karpathy教学视频,分析大模型聊天流程与原理,介绍LLM训练步骤,包括预训练、后训练和强化学习,还提及主流特性应用,如文件上传、网络搜索,强调带问题学习的重要性。

腾讯技术工程
开源动态8

ViT一作盛赞:这个中国开源“PS模型”强过Nano Banana

ViT核心作者Lucas Beyer连发三条帖子怒赞通义千问发布的开源模型Qwen—Image—Layered,认为这是图像生成的正确打开方式。该模型可实现PS级拆图自由,支持精细化修改图片元素,核心技术是端到端的扩散模型。

量子位
开源动态7

这张信息图,居然是8B开源模型做的??

商汤新开源的 8B 多模态模型 SenseNova U1,架构独特,图像评测表现好,信息图生成能力强、延迟低。它具备图文交错能力,适合自媒体、敏感行业等,有在线体验和开源代码入口。

花叔
开源动态7

干掉延迟!12G显存就能实现实时AI换脸直播,开源免费。

推荐开源项目PersonaLive,它是基于自回归流式扩散技术的实时人像动画生成框架。能平衡画质与低延迟,用一张照片在普通显卡实现数字分身实时驱动,有低显存、无限时长等特点。

开源AI项目落地
产品应用7

实测新版LiblibAI:终于把模型、生图、工作流塞进一个碗了

本文实测新版LiblibAI,它上线多个模型,添加视频特效玩法。从“找模型”网站变为“AIGC流水线”平台,界面风格转变。虽有亮点,但也存在出图慢、模型惊喜感弱、页面卡顿等问题。

量子位