照片转视频」共找到 1114 篇相关文章

算法论文8

免剪辑直出!AI生成多角色同框对话视频,动态路由精准绑定音频

Bind-Your-Avatar基于扩散Transformer框架,通过细粒度嵌入路由将语音与角色绑定,实现精准音画同步,还引入数据集MTCC和基准测试,实验显示其在身份保真和音画同步上优于现有方法。

新智元
新闻资讯7

「流匹配」成ICML 2025超热门主题!网友:都说了学物理的不准计算机

第42届国际机器学习大会(ICML)2025年7月将在加拿大举行,生成式AI前沿热点向高质量、稳定、简洁、通用模型形态,流匹配技术踩中热点。它源于流体力学,能将噪声化为数据,与扩散模型有紧密联系。

机器之心
算法论文8

打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26

现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。

量子位
新闻资讯7

每周产业洞察 | AI音视频模型能力全面嵌入“专业级视听内容”交付,对齐“制作级”

北京AIGC视听产业创新中心位于朝阳区,是朝阳区推动影视制作基地建设举措。由多方参与,首创郎园运营,提供六大服务平台,截至2025年8月汇聚近百家合作伙伴。首创郎园拓展服务能力,项目多地开花。

郎园Station
产品应用7

Google 推出了免费 Vibe Coding 工具,一键集成聊天、视频、图像AI,真的很氛围。

谷歌推出免费 Vibe Coding 工具,集成多种 AI 功能。谷歌 AI Studio 的 Built 模式更新,能混合匹配 AI 功能,自动连接模型和 API。用户无需了解 API 文档,可快速做出 MVP,谷歌 AI API 免费(限速)。

AI进修生
新闻资讯7

盘点AI爆火以来的割韭菜骗局,我的照片都被偷拿去搞诈骗了。。。

作者作为AI行业博主,分享AI爆火以来的割韭菜骗局,包括卖盗版软件、天价提示词、卖课、证书与算法课、克隆声音形象等,提醒大家擦亮双眼,避免成为下一个受害者。

开源AI项目落地
产品应用8

从0到1拆解FreeWheel ChatBI:大模型如何重塑视频广告智能数据分析新生态

本文结合 FreeWheel 实际应用经验,分享构建 ChatBI 系统核心实践。介绍其核心功能、技术实践,如让 LLM 理解业务、智能选表等,还提及系统架构、算法服务,最后总结上线效果并展望未来优化方向。

InfoQ
开源动态8

GitHub 1.3k 一款能“填色回忆”的神器:DDColor 让老照片鲜活又逼真

DDColor是阿里达摩院团队提出的新一代图像自动着色模型,基于双重设计,能实现高保真、真实感强的黑白图彩色图。它兼容多种类型图片,有诸多核心功能,相比传统模型优势明显,应用场景广泛。

小华同学ai
新闻资讯8

斯坦福吴佳俊「计算机与思想奖」获奖演讲全文:从一张照片,逆推一个世界|IJCAI 2026

8月20日,斯坦福大学吴佳俊在IJCAI 2026发表“计算机与思想奖”获奖演讲。他指出像素是表象,物理结构才是因果,提出以物理代码为桥,融合基础模型泛化力与物理模拟因果性,构建视觉与物理智能。

AI科技评论
产品应用8

谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...

谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。

AI寒武纪