「全身视觉运动控制」共找到 742 篇相关文章
波士顿动力 | 人形机器人Atlas ,最新研究进展!
世界人形机器人运动会引发对自主机器人的讨论。波士顿动力与丰田研究院合作为 Atlas 开发大型行为模型(LBM),使其能自主完成复杂任务,研究团队展示成果并介绍模型构建流程、实践成果及研发原则。
DeepMind 没舍得开源的 Genie 3,被昆仑万维放出来了
过去一周世界模型赛道热度高涨,DeepMind发布的Genie 3未开源,昆仑万维却在8月12日推出自研升级版Matrix - Game 2.0并完整开源。它定位产业化,能让世界模型从实验室走向生产线,还带来盈利模式转变。
AI 陪伴硬件的反共识讨论:主体性很重要,同质化竞争不存在
文章围绕AI陪伴硬件展开讨论,邀请创业者探讨产品角色定位、性别设定、用户反馈等问题。指出产品应注重主体性,避免破坏角色感,还提及应对同质化竞争、产品寿命、视觉研究等方面的思路。
精准复刻!字节推出X-UniMotion实现高精度动作模仿合成
字节推出的X-UniMotion代表角色动画技术突破,提供统一运动控制系统,融合先进算法与操作界面,构建强大技术架构,能生成自然流畅角色动作,还介绍了其技术原理、演示对比等内容。
AI世界名画复活走秀爆了,全网疯转!梵高达利莫奈同框谢幕,网友哭崩
国外ODDY工作室借助AI让世界名画及角色复活,打造超写实视频《名作艺术秀》。视频中梵高、达利等大师及作品化身“T台模特”,还有“幕后故事”,带来视觉盛宴,引发网友热议。
一键抠图有多强?19Kstar 的 Rembg 开源神器,5 大实用场景颠覆想象!
在视觉内容需求旺盛的当下,背景抠图工具至关重要。Rembg 是能在本地完成高质量图片背景抠图的开源利器,累积 19.1K ⭐。本文通过项目详解等带你深度了解它的魅力。
清华许华哲:具身智能需要从 ImageNet 做起吗?
清华许华哲探讨具身智能,分析其爆发原因、失败模式及决策点,涉及视觉信号输入、触觉应用、学习方法等,还探讨具身智能是否需‘ImageNet时刻’,并从宏观视角谈智能的共性。
上手“设计界的Manus”,朱啸虎点赞,Lovart这波魔法破圈了丨TIP 002
国产出海产品Lovart被称为“设计界的Manus”,获朱啸虎点赞。它是设计领域首个Agent,能用自然语言驱动生成多模态视觉作品,可生成VI体系、短片等,适合文创领域,还能人工编辑,调用多模型。
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26
大视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。
模型声称会“脑补”,结果被论文打脸了?潜在空间想象竟是“摆设”!
多模态大模型中“潜在视觉推理”概念很火,研究者让模型在潜在空间“想象”。但清华和北交学者论文指出,潜在 Token 不关心输入、不影响输出、没信息量。作者提出 CapImagine 方案,效果远超潜在空间方法。