第一视角视频问答」共找到 1415 篇相关文章

开源动态7

OmniAvatar震撼开源!阿里夸克开源全新音频驱动角色模型

音频驱动人体动画技术有局限,阿里夸克团队推出OmniAvatar模型。它用逐像素多层次音频嵌入和LoRA训练法,解决唇动同步等问题,适用于多领域,但也存在颜色偏移等不足。

带你学AI
推荐文章8

机器人为什么要拟人?终于有人正确回答了

今年6月,英伟达发布Isaac GR00T人形机器人参考平台,深度机智发布论文Human - as - Humanoid。具身智能瓶颈是数据,深度机智以人类学习范式破局,完成全栈技术闭环,领先优势扩大。

机器之心
算法论文8

浙大联合阿里云发布首篇 Token Economics 综述 :用经济学重新理解 LLM Agent 的 Token 世界

浙江大学联合阿里云发布综述论文,提出Token Economics框架,从经济学视角理解LLM Agent中Token使用与资源分配。梳理关键问题,构建分类体系,还指出未来发展趋势与新兴机会。

深度学习自然语言处理
新闻资讯8

Generalist最新长文定调:具身原生才是正道,中国玩家原力灵机已交卷

Generalist创始人Pete Florence团队释出GEN-1技术博客,否定世界模型与VLA之争,强调具身智能应回归目标,主张从零训练。中国原力灵机DM0也采用具身原生路线,在RoboChallenge评测中成绩优异。

量子位
新闻资讯7

告别Sora!从巅峰到黯然离场不到一年半,团队将转向物理AI

2026年3月24日,OpenAI宣布关闭视频生成应用Sora。Sora曾惊艳全球,但因合规麻烦、行业阻击、算力成本高、商业回报低等问题走向关停。团队将转向物理AI,聚焦世界模拟研究。

AIGC开放社区
产品应用8

豆包 Seed 2.0 来了:字节模型跨越鸿沟

春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。

MacTalk
新闻资讯7

meta收购manus的几点看法

探讨Meta收购Manus双方视角。Meta认为Manus有销售前景,想全吃利润;Manus因无流量属性、壁垒低、天花板低等因素,被收购或是好选择,还提及编程工具效用问题。

Agent的潜意识
新闻资讯7

Sora2“复活”已故名人,家属强烈反对

Sora 2走红后肖像权问题成焦点,有人用其“复活”迈克尔·杰克逊、罗宾·威廉姆斯等已故名人。罗宾女儿等家属强烈不满,OpenAI称公众人物及其家属应控制形象使用,美影协要求其解决侵权问题。

量子位
推荐文章8

2025 年 InfoQ 趋势报告:AI、ML 和数据工程

InfoQ AI ML 趋势报告基于编辑团队与嘉宾播客,总结 AI、ML 技术发展趋势。涵盖 AI 代理、多模态语言模型等创新领域,也提及早期采用者、早期多数、晚期多数类别的技术,还对 2025 年相关领域发展作出预测。

InfoQ
产品应用7

实测美团 LongCat:快到极致,但是别说追平 DeepSeek

AI科技评论实测美团LongCat-Flash-Chat,它是中量级对话模型,主打“快”,几乎零延迟。但在推理、抗污染能力等测试中,相比DeepSeek-V3.1,逻辑链条松散,缺乏清晰判断。速度与逻辑哪个更重要,值得思考。

AI科技评论