「视觉语言预训练」共找到 3310 篇相关文章
田渊栋被裁后新offer排到法国!原来Llama 4.5训完后被卸磨杀驴了
Meta此次裁员引发诸多争议,工作超十年的田渊栋整组被裁。有说法称是因没做出基于Llama 3的推理模型,但田渊栋否认。Llama 4.5训练好后团队被裁,且后续还将裁风控部门。不过田渊栋获多家公司青睐。
CVPR 2025 Award Candidate | 英伟达等Difix3D+:用单步扩散模型修复 3D 重建伪影
3D重建领域中,NeRF和3DGS在新视角生成时易出现伪影,影响应用。英伟达团队提出Difix3D+,将预训练2D扩散模型用于3D渲染,单步去伪影,效率高、有泛化力,实验效果领先。
Facet-0:NTU王子为团队让机器人在精密装配中「看得懂、插得准、出错能恢复」
新加坡南洋理工大学PINE Lab团队研发Facet - 0机器人基础模型,用于精密装配。它在五项计算机装配任务中平均成功率达82%,能让机器人理解接触状态、判断对错并改进。通过多阶段训练,降低人工干预率,提高失败恢复率。
实测可灵3.0 - 属于每个人的导演时代。
可灵更新至3.0版本,将视频模型能力提升到新高度。它有分镜和语言两大升级方向,还升级了Omni模型。可灵3.0适合文生视频等,3.0 Omni擅改视频,二者结合能覆盖多数视频生成场景。
ICML2025 | 揭示MLLM的图文联动推理能力
当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。
微软刚发布Mu模型:支持Windows智能体,小参数跑出10倍性能
今天凌晨微软发布创新小参数模型Mu,3.3亿参数性能比肩Phi - 3.5 - mini,体量小10倍,离线NPU笔记本每秒超100 tokens响应。它支持Windows智能体,架构有多项创新,经训练优化后智能体表现出色。
00后投身具身智能创业,剑指机器人界「Model 3」!已推出21个自由度灵巧手
具身智能创业公司灵初智能推出自研灵巧手,每只手21个自由度,操作能力强。其目标是将机器人整机价格打到17000美元,走‘Model 3式的产业破局之路’,还提出分层端到端算法解决训练难题。
刚刚,GPT-5.2满分屠榜,OpenAI十周年王者归来
OpenAI 十周年推出 GPT - 5.2 系列模型,包括 Instant、Thinking 和 Pro 版本。它在多方面表现出色,刷新多项基准测试 SOTA 水平,如 AIME 2025 获满分,在 GDPval 达人类专家水平。还在编码、视觉理解等能力上有显著提升。
WAIC现场最“聪明”展台!AI眼睛耳朵能力全打开了
WAIC现场,声网展台被观众挤爆,其新奇“AI玩具”都能与玩家流畅对话。声网对话式AI引擎全新升级,新增选择性注意力锁定、视觉理解能力,能与主流数字人方案集成,还可接入大模型,价格低。它已在多领域落地。
机器人需要一个「思考系统」:τ0-VLA让具身智能迈向长程任务时代
2026 WAIC落幕,具身智能成焦点。当前VLA模型在长程任务中有局限,上海创智学院和智元机器人联合发布τ(0)-VLA,提出分层架构和新推理机制,用大量真机数据训练,在长程任务表现出色。