视频评估」共找到 1657 篇相关文章

8

无限长、零掉帧!StableAvatar口型同步全新技术

当前音频驱动头像视频生成扩散模型合成长视频时难兼顾音频同步与身份一致,瓶颈在音频建模。复旦大学提出StableAvatar,首个端到端视频扩散Transformer,能无限时长生成,还介绍原理与演示效果。

带你学AI
开源动态8

当Sora 2意外停摆,这个国产视频生成创业团队,直接「开源」三连击

OpenAI叫停Sora 2项目,同期北京AI初创公司Sand.ai在GitHub连续三天开源核心技术栈,包括音视频同出大模型、分布式Attention组件、全局编译框架,还介绍了团队和产品,展现全栈实力。

机器之心
算法论文8

解锁任意步数文生图,港大&Adobe全新Self-E框架学会自我评估

香港大学与Adobe Research联合发布Self - E框架,可从零训练实现任意步数文生图。它改变训练范式,用两条互补训练信号,在GenEval基准表现出色,让文生图训练更灵活且具扩展性。

机器之心
算法论文8

SIGCOMM 2025|重新定义个性化视频体验,快手与清华联合提出灵犀系统

快手与清华孙立峰团队联合发表论文,提出灵犀系统,这是业界首个大规模生产环境中面向用户个性化体验的自适应视频流优化系统。该系统能解决现有方法在部署中的难题,实现个性化QoE优化。

机器之心
开源动态7

SGLang|SGLang Diffusion

来自SGLang开源社区的Yichi介绍SGLang Diffusion,它是面向图像与视频生成的全开源扩散模型推理引擎。基于SGLang机制将能力迁移到扩散模型推理,能显著提速工作流,视频展示了多种功能。

GiantPandaLLM
产品应用7

比修驴蹄还魔性!谷歌这7段纸片动画,看完焦虑没了,第2支直接封神

全球网友爱刷解压视频,谷歌Gemini下场做带提示词的解压视频。它推出7段纸艺动画,包括火烈鸟起舞、圣托里尼落日等,靠高精准提示生成等打造,拓展想象边界,是通往美学与治愈的桥梁。

新智元
开源动态8

这款开源工具 deface,支持一键人脸打码,告别逐帧处理!

如今拍视频常出现路人,手动逐帧打码工作量大。开源工具 deface 可自动检测视频/图片中所有人脸,实现一键匿名化处理,还能处理摄像头实时画面,简单易用。

开源星探
算法论文8

北航LiveRepoReflection: 扭转乾坤-仓库级代码反射

本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。

PaperAgent
算法论文8

解决Agent幻觉:HaluMem精准定位记忆系统的“说谎”环节!

近年来,LLM和Agent在记忆管理上存在挑战,现有评估方法无法定位幻觉来源。论文提出HaluMem评估基准,通过三大任务和两个数据集揭示记忆系统幻觉行为,为开发可靠记忆机制提供指导。

深度学习自然语言处理
开源动态8

最低仅需2G显存,谷歌开源端侧模型刷新竞技场纪录,原生支持图像视频

今天凌晨,谷歌官宣Gemma 3n,原生支持多模态。它在大模型竞技场超1300分,是首个超此分数的10B以下模型。其VRAM占用低,最低2GB,已在谷歌AI Studio等可用,还公开了技术细节。

量子位