视觉-文本激活编辑」共找到 1120 篇相关文章

新闻资讯8

刚刚,李飞飞主讲的斯坦福经典CV课「2025 CS231n」免费可看了

斯坦福大学经典CV课程《CS231n:深度学习与计算机视觉》(2025春季)正式上线,学生能学习实现和训练神经网络。课程由李飞飞等四人主讲,全部18个视频可在Youtube免费看。

机器之心
开源动态8

腾讯开源Stand-In!轻量级身份保留视频生成新突破

生成符合指定身份的高保真视频挑战大,现有方法依赖大参数且兼容性不足。腾讯开源轻量级、即插即用的Stand - In框架,在身份保留文本生成视频任务中性能先进,兼容性强,有广阔应用潜力。

带你学AI
开源动态8

DeepMind 没舍得开源的 Genie 3,被昆仑万维放出来了

过去一周世界模型赛道热度高涨,DeepMind发布的Genie 3未开源,昆仑万维却在8月12日推出自研升级版Matrix - Game 2.0并完整开源。它定位产业化,能让世界模型从实验室走向生产线,还带来盈利模式转变。

AI科技评论
新闻资讯7

又是浙大校友!AI眼镜“隔空取物”,戴上即可随心选中现实世界任意物体

混合现实重塑人机交互边界,但传统XR设备选物易出错。研究团队提出Reality Proxy,即现实物体的抽象数字表示,将交互目标转移到代理上,便于用户摆脱限制选物,还支持多种交互功能。

量子位
推荐文章7

【陪跑计划专访】孙淳:梦神观|三影堂北京

三影堂“青年艺术家陪跑计划”入围者孙淳,其个展“梦神观”于2025年7月5日至24日在三影堂摄影艺术中心展出。展览涉及多种媒介,孙淳分享创作思考,还谈及与导师交流感想及后续创作方向。

三影堂摄影艺术中心
新闻资讯7

AI 陪伴硬件的反共识讨论:主体性很重要,同质化竞争不存在

文章围绕AI陪伴硬件展开讨论,邀请创业者探讨产品角色定位、性别设定、用户反馈等问题。指出产品应注重主体性,避免破坏角色感,还提及应对同质化竞争、产品寿命、视觉研究等方面的思路。

Founder Park
新闻资讯7

作为软件架构师使用 AI 的经验

Avraham Poupko 在 OOP 大会分享软件架构师用 AI 经验,认为软件架构师不会被 AI 取代,AI 适合探索权衡、提炼语言,但缺乏情境推理和情感智能,人类在这方面更有优势。

InfoQ
算法论文8

首次!世界模型、动作模型融合,全自回归模型WorldVLA来了

阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。

机器之心
开源动态7

开源端到端语音大模型:直接从原始音频输入,生成语音输出

目前大模型大多只能输出文本,人机音频交互不顺畅。Step - Audio团队开源端到端语音大模型Step - Audio - AQAA,能直接听懂音频问题并合成语音回答,介绍了其架构和各核心模块。

AIGC开放社区
产品应用8

AI世界名画复活走秀爆了,全网疯转!梵高达利莫奈同框谢幕,网友哭崩

国外ODDY工作室借助AI让世界名画及角色复活,打造超写实视频《名作艺术秀》。视频中梵高、达利等大师及作品化身“T台模特”,还有“幕后故事”,带来视觉盛宴,引发网友热议。

新智元