「视觉指令微调」共找到 1141 篇相关文章
10万引普林斯顿刘壮最新访谈:架构没那么重要,数据才是王道
普林斯顿大学助理教授刘壮在访谈中指出,架构没那么重要,数据、规模和记忆才是决定AI成败的关键。他认为ConvNet和Transformer性能差异源于训练细节;当前数据集远不够多样;大语言模型有语言空间的世界模型,但视觉空间的还缺失;记忆是瓶颈,智能体只是权宜之计;AI目前还替代不了研究生。
大模型外挂“三维物体知识库”来了,大幅增强机器人长程自主操作能力
现有视觉语言大模型(VLM)能让机器人理解指令,但在操作中缺三维空间知识。近日研究提出 RAM 框架,它像“三维物体知识库”,为 VLM 补充空间知识,经 14 项实验验证其操作能力,还探索了在铰接与柔性物体操作中的应用。
首创像素空间推理,7B模型领先GPT-4o,让VLM能像人类一样「眼脑并用」
当前主流视觉语言模型(VLM)依赖文本token间接翻译视觉信息,缺乏直接视觉操作能力。滑铁卢大学等团队提出「像素空间推理」范式,让VLM能像人类一样「眼脑并用」,在四大视觉推理基准测试中,7B的Pixel - Reasoner表现碾压GPT - 4o等。
触觉具身来了个梦之队:天使轮近亿
5月27日,上海新智具身智能科技有限公司宣布完成近亿元天使轮融资。该公司源自复旦大学,核心团队实力强。它聚焦触觉具身智能,构建技术闭环,在数据采集、模型训练等方面有进展,已在工厂落地POC验证订单。
给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策
上海交通大学和小红书团队推出面向通用视觉 Agent 的多模态技能框架 MMSkills,将可复用技能扩展为多模态程序性知识,通过 branch loading 调用视觉证据,在 GUI 与游戏任务评测中表现出色。
ChatGPT架构师,刚发布了最新研究成果
Thingking Machines发布第三篇研究博客,核心作者是OpenAI联创John Schulman。研究关于LoRA参数高效微调方法,探究其匹配全量微调效率的条件,给出简化调参方案,还提炼出三个核心发现。
看完最新国产AI写的公众号文章,我慌了!
AI 快砸作者饭碗,智谱 GLM - 4.6V 能根据 NeurIPS 2025 最佳论文生成图文并茂的公众号文章。它还能助力学生看论文、分析财报等,可复刻网站、处理视频,在多模态评测中达同级别 SOTA。
GPT正面对决Claude!OpenAI竟没全赢,AI安全「极限大测」真相曝光
OpenAI和Anthropic罕见合作,测试双方模型在幻觉等四大安全方面的表现。这场合作是AI安全的里程碑,百万用户每天的互动推动安全边界扩展。文中详细对比了GPT和Claude模型在各安全测试中的表现。
从VLA到RoboOmni,全模态具身新范式让机器人察言观色、听懂话外音
复旦大学等联合推出全模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现全面领先。
模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作
北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。