「多模态数字人」共找到 2206 篇相关文章
宇树科技开源UnifoLM-WMA-0机器人模型,离通用机器人又进一步
宇树科技开源UnifoLM-WMA-0模型,用神经物理网络让机器人理解力学规律。它支持两种模式,融合多模态信息,架构精妙。经测试性能强,已真机部署。开源降低门槛,有望推动行业发展。
找ChatGPT谈恋爱多是“日久生情”?!MIT&哈佛正经研究
麻省理工和哈佛研究人员分析Reddit子版块r/MyBoyfriendIsAI帖子,揭露人们找“AI男友”动机与相处过程,发现人们多“日久生情”选ChatGPT,模型更新是噩梦,AI还能缓解心理问题。
三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!
快手开源多模态Keye-VL 1.5,为8B视频理解大模型,公开3大核心创新技术。靠Slow - Fast视频编码等,在20 + 基准屠榜。它能精确视频定位,实验显示通用、视频理解和数学推理表现佳。
纽约客:人工智能热潮,正在演变为一场泡沫吗?
科技巨头股价攀升、惊人 IPO 重现,让人想起互联网泡沫时代。作者探讨人工智能热潮是否会演变为泡沫,分析了当前与九十年代的异同,指出虽有泡沫迹象,但也存在差异,一切仍不确定。
Figure人形机器人首秀灵巧手叠衣服!神经网络架构不变,只增加数据集就搞定
Figure人形机器人首秀用灵巧手叠衣服,在未改变神经网络架构、仅增加数据的情况下,让原本用于物流场景的它习得新技能,完成了端到端的操作,还实现自然多模态交互。
AI 编程冲击来袭,程序员怎么办?IDEA研究院张磊:底层系统能力才是护城河
在 AICon 大会上,IDEA 研究院张磊剖析多模态智能体发展难题,提出从“半结构化”场景切入的落地路径,分享工业界研究与产品平衡见解,还为年轻人在 AI 浪潮中发展给出建议。
又是浙大校友!AI眼镜“隔空取物”,戴上即可随心选中现实世界任意物体
混合现实重塑人机交互边界,但传统XR设备选物易出错。研究团队提出Reality Proxy,即现实物体的抽象数字表示,将交互目标转移到代理上,便于用户摆脱限制选物,还支持多种交互功能。
Gamma 创始人:小团队创业是共识,怎么做好才是最大的问题
AI创企Gamma 30人服务近5000万用户,ARR超5000万美元且持续盈利。创始人Grant Lee分享创业心得,包括小团队组织模式、重视通才、可持续业务理念、组织创新及应对PMF等问题的思路。
ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链
随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。
不怕被挖!谷歌晒IMO金牌团队大合照,还挨个圈出了联系方式
谷歌获IMO金牌后部分成员被小扎挖走,但其IMO金牌团队晒全家福回应。团队负责人透露赛前准备细节,还介绍核心成员情况,包括4位华人成员。