「视觉预训练」共找到 2667 篇相关文章
DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角
DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。
Gemini负责人爆料!多模态统一token表示,视觉至关重要
Gemini模型行为产品负责人Ani Baddepudi与谷歌AI Studio产品负责人探讨Gemini多模态技术,涉及设计理念、应用及发展方向。指出多模态对构建AGI重要,还介绍Gemini 2.5视频理解亮点与‘万物皆视觉’理念。
ICML 2025 | 无需训练,即时对齐大模型偏好
上海人工智能实验室提出TPO方案,可让大模型在推理时快速对齐人类偏好,无需更新模型权重。TPO类似文本形式的梯度下降,在多个基准数据集评测中表现出色,还提供“宽深结合”推理拓展策略。
南京艺术学院人工智能与计算机视觉算法创新设计成果展示
南京艺术学院‘人工智能与计算机视觉算法创新设计工作坊’汇集师生与专家成果,涵盖多种艺术形式。学生学习多技术完成跨媒体作品,如以《大闹天宫》为蓝本的交互装置,还有探索情绪、文化等主题的作品。
本地运行、支持视觉与工具调用:Meta 开源智能体模型
Meta AI Research 推出 300 亿参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可证。它专为本地工作流设计,能在消费级硬件运行,经多项优化,在基准评估中表现出色,还支持多种框架。
训练机器人方式对了吗?英伟达DreamZero双榜第一新反思
NVIDIA的DreamZero在RoboArena和MolmoSpaces基准测试双登顶。分析文章《Why is DreamZero so good at robotics?》从多维度拆解其表现突出原因,质疑传统认知,如数据量并非万能,模型规模和信息输入方式也很关键。
视觉优势还是语义依赖?揭秘 DeepSeek-OCR 高压缩率背后的真相
中科院等团队论文剖析 DeepSeek - OCR,通过实验揭示其高压缩率下准确率高或依赖语言先验。去掉语言先验,准确率暴跌;下游任务推理崩塌,长文本处理也有瓶颈。
真·养虾!3步让龙虾边聊边进化,不用GPU不用数据集就能强化学习
程序员给智能体套在线强化学习系统MetaClaw,把用户与AI对话变训练数据。它基于Kimi - 2.5,用SkillRL框架,不依赖本地GPU,训练交Tinker云平台,三步即可上手。
无需训练,直接「算出」最强AI!理想汽车发现端侧Scaling Law
理想汽车基座模型MindVLA团队与国创决策智能技术研究所联合发布论文,提出面向端侧大语言模型的「硬件协同设计扩展定律」,解决大模型部署在端侧设备的难题,实现软硬协同设计,提升模型性能和研发效率。
合合信息:基于 JuiceFS 构建统一存储,支撑 PB 级 AI 训练
合合信息为应对AI训练存储挑战,引入JuiceFS构建统一存储架构,结合BeeGFS作缓存。该架构提升I/O性能与资源调度效率,还通过缓存优化、数据治理等措施,支撑多业务并发,为AI基建奠基。