视觉记忆」共找到 1167 篇相关文章

算法论文7

InfiniteTalk:音频驱动的从口型到全身动作同步方法

近年来视频AIGC推动音频驱动人体动画变革,但传统视频配音局限口部。中国科学院大学提出稀疏帧视频配音范式,推出InfiniteTalk生成器,结合多种技术实现全身动作与音频同步,实验表现突出。

带你学AI
新闻资讯8

2025 WAIC落幕,深谋科技异军突起,以技术与落地破局具身智能赛道

2025 WAIC落幕,深谋科技作为精英合作伙伴首次亮相,未随波逐流,而是切入脑控、动态视觉伺服和康养场景三大底层能力领域,开拓创新赛道。其产品已商用部署,吸引众多媒体关注。

AI科技评论
产品应用7

飞书MCP不好用?我一天自研了人生教练MCP (v3.0)| 附:我的AI启发

作者因飞书MCP更新与期望不符,花一天自研人生教练MCP组件。介绍了人生教练Agent特点,还给出启动方法,最后分享在MCP实践中发现的AI趋势及实践总结。

AI 产品自由
开源动态8

论文秒变海报!开源框架PosterAgent一键生成顶会级学术Poster

本文介绍开源框架PosterAgent,它能一键将论文转为可编辑的学术海报。相比GPT - 4o,其生成指标优、token使用量少、成本低。研究团队构建评估标准Paper2Poster,实验显示PosterAgent在多方面表现出色。

量子位
新闻资讯7

大模型玩不好数独?!Transformer作者初创公司公布排行榜:o3 Mini High“变异数独”正确率仅2.9%

Transformer作者初创公司Sakana AI公布AI解决数独能力排行榜,用全新基准Sudoku - Bench考验大模型创造性推理能力。结果显示大模型总体正确率仅15%,9×9数独中高性能模型o3 Mini High正确率2.9%。

量子位
新闻资讯8

Gemini 2.5 Pro登顶三冠王!AI最强编程屠榜,全面碾压Claude 3.7

谷歌Gemini 2.5 Pro(I/O版)横空出世,登顶LMAreana获文本、视觉、编码三连冠,编程能力碾压Claude 3.7。开发者可通过Google AI Studio等使用,其应用演示展现强大实力。

新智元
新闻资讯7

AI短片节创作者招募:在崇礼,用AI讲一个未来故事|甲子光年

「Future Now/未来此刻」2026夏季崇礼论坛将启幕,设立「Chongli AI Film Lab」专场论坛,发起AI短片节。面向全球创作者征集作品,有两大创作方向,生数科技Vidu全程支持,对作品有要求,还有丰厚奖励。

甲子光年
算法论文8

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

香港中文大学(深圳)等高校联合腾讯发布 GameCraft-Bench,旨在构建基于真实游戏引擎、产物完整可运行且能验证的 AI 游戏生成评测基准,解决现有基准难衡量端到端可玩性的问题,测试显示前沿模型在游戏生成上仍薄弱。

AI科技评论
算法论文8

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

AI视频生成技术发展快,现有检测方法难满足需求。新综述提出‘事实保真度验证’目标,梳理四层检测框架,涵盖底层线索、时空一致性等,强调多层证据耦合与可解释性,还分析评测指标与数据集。

新智元
开源动态8

The Batch: 943|液体和气体如何运动

传统数值方法模拟复杂物理系统慢且贵,基于机器学习的模拟通常只适用于特定系统。研究人员构建通用 transformer 模型 Walrus,可模拟流体运动,开源且在多方面表现出色,有望加速多领域模拟工作。

DeeplearningAI