「图像到视频」共找到 3235 篇相关文章
机器人“会用手”了!银河通用首破手掌任意朝向旋转难题,拧螺丝、砸钉子样样精通
银河通用推出的灵巧手神经动力学模型DexNDM,让灵巧手实现从能动到能用的飞跃。它首次突破手掌任意朝向旋转难题,实现跨物体、跨姿态稳定操作,助力机器人迈向精细操作,推动灵巧操作走向生产力基础设施。
AI看不到的爱心,成了最棒的AI检测器。
作者以漂浮爱心图检测AI,Gemini 2.5 Pro、GPT - 5等模型均失败。又用噪点鹿视频测试,AI准确率为0%。原因是AI是空间王者、时间瞎子,无“共同命运法则”视觉系统,存在时间盲视。
RAG终极框架!港大开源RAG-Anything:统一多模态知识图谱
香港大学黄超教授团队发布开源项目RAG - Anything,构建统一多模态知识图谱架构,解决传统RAG技术局限。它能处理多类型异构内容,提供端到端方案,有多种优势及应用模式,还给出部署指南和未来展望。
Veo 3逼真脱口秀爆火全网,网友:彻底超越恐怖谷!Sora已被完爆
Veo 3生成的脱口秀视频全网爆火,人物、场景真实,声音和嘴型能对上,已超越恐怖谷。它或让人类进入‘模糊时代’,还会颠覆游戏、电影、广告等行业,未来AI生成内容或远超非AI内容。
清华发布世界模型评测新标尺:直击机器人感知与行动鸿沟
清华大学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示模型在感知与行动上的差距,转型为实用型模型是行业挑战。
一张图生成任意场景3D模型,部分遮挡也不怕|IDEA x 光影焕像联合开源
IDEA研究院张磊团队与香港科技大学谭平团队联合推出SceneMaker框架,以DINO - X与Triverse为基础,实现从任意开放世界图像到带Mesh的3D场景完整重建,解决遮挡难题,有多项创新,应用场景广泛。
Skills的最正确用法,是将整个Github压缩成你自己的超级技能库。
文章指出重复造轮子不可取,Skills可将Github开源项目封装成技能库。以FFmpeg、yt - dlp等为例,介绍封装流程,还提及多场景应用,如视频下载、格式转换等,让普通人能利用开源成果。
无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab
多图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。
“AI不是工具,是工人!” 英伟达GTC 2025,黄仁勋如是说
英伟达GTC 2025大会上,黄仁勋提出“AI不是工具,是会用工具的工人”,重新定义人类与技术关系。阐述AI产业本质、三大扩展定律,公布GPU路线图及新硬件,还将AI部署到多行业,构建全栈生态。
1万块GPU砸向欧洲!老黄怒怼AI末日论:全球首个工业AI云来了
巴黎GTC大会上,黄仁勋表示AI是伟大平等工具,驳斥AI致大裁员预测。英伟达卖1万块GPU建工业AI云,还宣布DGX Lepton项目。此外回顾AI发展,从感知到具身智能,介绍其应用及加速计算等成果。