「视觉 - 触觉融合」共找到 1159 篇相关文章
抖音SAIL团队联合港中文MMLab推出SAIL-Embedding:打通「视、文、音」的全模态嵌入
字节跳动抖音SAIL团队联合港中文MMLab提出SAIL - Embedding,专为大规模推荐场景设计,实现视、文、音统一表征,解决传统多模态模型局限,在抖音业务场景效果显著,相关技术报告已公开。
中国产业叙事:中际旭创
本文讲述中际旭创发展历程。它原是电机绕组设备厂,2017年收购苏州旭创跨界光通信。借AI算力浪潮,2023年首发1.6T光模块,2024年营收、利润大增,成全球光模块市场榜首企业,还分析了光模块技术趋势。
一图胜千言被实现了!DeepSeek-OCR用图片压缩文本,10倍压缩率
DeepSeek开源DeepSeek - OCR,用图片压缩文本达10倍压缩率且几乎不丢信息。它解决了以往视觉编码器的问题,架构清晰,数据丰富,性能测试亮眼,为解决大模型‘记性差’问题提供新思路。
具身智能迎来ImageNet时刻:RoboChallenge开放首个大规模真机基准测试集
近日,RoboChallenge推出全球首个大规模、多任务真机基准测试。它构建开放、公正、可复现的‘真实考场’,为视觉 - 语言 - 动作模型提供评估标准,推动具身智能发展,还提供远程测试服务等。
宇树科技开源UnifoLM-WMA-0机器人模型,离通用机器人又进一步
宇树科技开源UnifoLM-WMA-0模型,用神经物理网络让机器人理解力学规律。它支持两种模式,融合多模态信息,架构精妙。经测试性能强,已真机部署。开源降低门槛,有望推动行业发展。
史诗级和解:英特尔获老对手英伟达超350亿投资,股价创38年最大单日涨幅
英伟达将投资英特尔50亿美元,双方联合开发定制CPU和GPU集成产品。合作旨在融合AI加速与通用CPU,覆盖多市场。曾有纠纷的二者此次合作,或助英特尔借AI突围。
字节发了个机器人全能大模型,带队人李航
字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。
刚刚,李飞飞主讲的斯坦福经典CV课「2025 CS231n」免费可看了
斯坦福大学经典CV课程《CS231n:深度学习与计算机视觉》(2025春季)正式上线,学生能学习实现和训练神经网络。课程由李飞飞等四人主讲,全部18个视频可在Youtube免费看。
千支队伍争锋!首届「启智杯」算法大赛圆满落幕,助推AI应用落地
2025年5月20日启元实验室启动「启智杯」算法创新应用挑战赛,7月25日落幕。赛事设三大赛道,吸引1022支队伍参赛。华南理工大学、陕西师范大学、西北农林科技大学及中山大学团队分获冠军,方案为行业提供启示。
DeepMind 没舍得开源的 Genie 3,被昆仑万维放出来了
过去一周世界模型赛道热度高涨,DeepMind发布的Genie 3未开源,昆仑万维却在8月12日推出自研升级版Matrix - Game 2.0并完整开源。它定位产业化,能让世界模型从实验室走向生产线,还带来盈利模式转变。