「多模态数字人」共找到 2201 篇相关文章
人类首次机械飞升!马斯克豪言Neualink击败全人类
马斯克发推称Noland可能首接受Neuralink升级或植入双芯片,还豪言接受者能在动作游戏击败所有人。Neuralink已植入12人,累计超2000天,还提交人体数据论文、开启意念生成文字试验。
首次!世界模型、动作模型融合,全自回归模型WorldVLA来了
阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。
7万个模型、1600万开发者,阿里魔搭已建成中国最大AI开源社区
首届魔搭开发者大会公布,魔搭社区开源模型超7万个,用户达1600万,成中国最大AI开源社区。阿里云CTO周靖人认为‘云端协同’是重要课题,魔搭要覆盖模型全生命周期,减少模型落地差距。
绝美无痕,比你还会P图的Agent!仅通过自然语言指令,灵活使用数百工具,超越GPT-4o达60%
JarvisArt提出多模态大模型驱动的智能Agent,通过理解自然语言指令,协调200+个Lightroom工具,实现媲美专业修图师的非破坏性编辑。其内容保真度超越GPT - 4o达60%,为AI艺术创作开辟新路径。
OpenClaw 一键接入飞书最简单的方式,出现了!
作者作为安装 OpenClaw 的技师,起初安装方式效率低。后飞书推出在“飞书妙搭”一键接入 OpenClaw 的方法,还自动安装官方插件,其功能强大,可让 AI 助手像“数字同事”参与协作。
3天霸榜GitHub Trending,这个群体智能体能预测万物
MiroFish是基于多智能体技术的AI预测引擎,可构建平行数字世界推演未来。它前身BettaFish曾爆火,作者受其启发开发此项目。文中还介绍了工作流程、部署方式及项目地址。
ACMMM 2025 | 北大团队提出 InteractMove:3D场景中人与可移动物体交互动作生成新框架
北大团队在ACMMM 2025发布InteractMove,首次提出含可移动物体3D场景中基于文本的人 - 物交互生成任务,构建数据集与创新框架,在多指标领先,代码与模型已开源。
上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”
上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。
押注Agent,林俊旸带着新公司杀回来了
前阿里Qwen负责人林俊旸创办Pragmatik Labs/语用科技,研究跨数字与物理世界的下一代agent。红杉中国、高榕创投领投,腾讯等跟投。其目标是用agent实现终极生产力,有独特技术底色与愿景。
DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!
4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。