预训练视觉表征」共找到 2650 篇相关文章

产品应用8

刚刚,小扎砸143亿的「牛油果」来了!硬刚GPT-5.4,硅谷最贵华人首作

Meta超级智能实验室首个作品Muse Spark上线,跑分从18飙到52,盘中暴涨10%。它是「全能六边形战士」,有原生多模态感知等能力,上线「沉思模式」,功能先在美国铺开,未来接入社交平台,免费用但闭源。

新智元
产品应用7

李飞飞World Labs双模齐发,能「造」超复杂大场景,一手实测

李飞飞的 World Labs 推出 Marble 1.1 和 Marble 1.1-Plus 两款模型。Marble 1.1 提升视觉效果,Marble 1.1-Plus 能生成更大更复杂场景。官方建议初用选 Marble 1.1,创建大场景用 1.1-Plus,还给出了实测和网友案例。

机器之心
算法论文8

一句话生成无限逼真3D场景!匹兹堡大学新作直击VLM空间推理软肋丨CVPR'26

VLM在3D空间推理上表现不佳,且缺乏合适测试基准。匹兹堡大学团队提出InfiniBench框架,用LLM Agent迭代优化和聚类策略,可按需生成3D场景,还能精准定位大模型空间推理缺陷。

量子位
算法论文8

USC团队发布HumDex:攻克人形机器人数据瓶颈,低成本实现全身灵巧操控

南加州大学团队提出HumDex系统,结合高精度便携追踪、手部控制算法和人类数据预训练机制,打破人形机器人高质量数据采集瓶颈,提升全尺寸操作泛化能力,经实验验证效果显著。

机器之心
新闻资讯8

具身Scaling Law押对了!独角兽新品1小时学会新任务,重复1800次成功率99%

具身智能独角兽Generalist推出新模型Gen - 1,它在精细任务上表现出色,成功率大幅提升、效率加快,验证了机器人领域的Scaling Law。研发团队重写数据处理架构,采用新技术提升性能。

量子位
新闻资讯8

第一视角效率超过真机,深度机智发布全球首个以人类学习范式构建的具身基座模型

2026年具身智能行业火热,但技术路线不明。深度机智创始人陈凯在中关村论坛发布具身智能基座模型PhysBrain 1.0,用千余小时人类第一视角数据超越真机数万小时数据成果,开启具身领域‘物理常识’革命。

AI科技评论
新闻资讯7

Gemini 3「开眼」像素级操控!谷歌回应DeepSeek-OCR2

Google DeepMind为Gemini 3 Flash推出Agentic Vision,让模型主动编代码操控图像,性能提升5% - 10%。该能力已上线,谷歌还计划扩展功能。这或许是受DeepSeek-OCR2刺激,两者技术路线不同。

新智元
新闻资讯7

独家丨段爱国离职,不再担任依图科技总裁

依图科技总裁段爱国在朋友圈宣布离开,已获公司同意。他2023年10月加入,任职时依图业务收缩、战略聚焦。此前他是华为机器视觉总裁,推动依图多领域发展。此次变动或暗示依图困境。

AI科技评论
开源动态8

黑森林FLUX.2 Klein开源,亚秒级高质量图像生成和编辑,普通电脑就能跑

黑森林实验室发布开源的FLUX.2 Klein模型家族,是紧凑架构,将高质量图像生成与编辑速度压缩至亚秒级,在消费级显卡实现旗舰性能。其统一架构打破生成与编辑壁垒,还与NVIDIA合作优化。

AIGC开放社区
开源动态8

多模态Qwen3-VL-Embedding开源&技术剖析

互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。

PaperAgent