「多模态学习」共找到 2201 篇相关文章
SOTA级的Embedding模型!F2LLM模型、数据、代码全部开源,人人可用
Embedding 模型应用广泛,但主流模型训练困难。蚂蚁集团与上海交大推出 F2LLM,含 0.6B、1.7B、4B 系列模型,仅用六百万数据微调基座,在 MTEB 榜单领先且完全开源。介绍了其数据、训练、测评等情况。
RL 将如何提高具身大模型 VLA 泛化性?清华大学团队NeurIPS 2025文章分析 RL 与 SFT 泛化性差异
清华大学团队在NeurIPS 2025发表文章,揭示强化学习(RL)提升具身大模型VLA泛化能力的优势,对比其与SFT差异,还提出评测基准和训练方法,为VLA训练提供新方向。
告别AI“乱画图表”!港中文团队发布首个结构化图像生成编辑系统
现有AI生图工具在结构化图像生成上问题多,理解与生成能力有鸿沟。港中文等校联合团队提出首个综合性方案,涵盖数据集构建、模型优化、评估基准三大模块,助多模态模型画准图,推动其发展。
亚马逊“盲眼”机器人30秒跑酷首秀惊艳!华人学者领衔
亚马逊机器人团队FAR发布人形机器人研究成果OmniRetarget,它能让强化学习策略在复杂环境学技能并零样本迁移。该成果通过交互网格建模关系,经实验验证优势明显,背后团队由华人学者领衔。
奥特曼:感受不到GPT-5变强,是因为你还不够「专业」
GPT-5发布后口碑不佳,直播事故、网友吐槽、专家唱衰不断,有人喊出‘AI第二次寒冬要来了’。但奥特曼认为这是节奏和期待错位,GPT-5在科研等高阶领域有提升,技术范式也有转变,且OpenAI仍看重规模。
突发!Meta刚从OpenAI挖走了清华校友宋飏
刚刚,OpenAI前高层研究员宋飏加盟Meta Superintelligence Labs任研究负责人,向赵晟佳汇报。此次人事流动或透露出Meta在AI竞赛中释放的三重信号,如MSL人才拼图更完整等。
超越免训练剪枝:LightVLA引入可微分token剪枝,首次实现VLA模型性能和效率的双重突破
文章介绍LightVLA框架,它是用于提升VLA推理效率和性能的视觉token剪枝框架。针对VLA模型计算开销大、推理延迟高问题,提出两大创新,在LIBERO实验中性能超经典模型,还实现推理加速。
CuteDSL-1: Introduction
文章介绍CuteDSL,它因Cutlass编译慢、调试难等痛点而生,可在Python构建DSL,编译快、调试易且性能无损。文中阐述其架构、使用方法、与PyTorch集成优势等,还提及基于CuTe的开发及性能对比。
Agentic Enterprise:生成式软件重新定义企业形态|AGIX PM Notes
文章指出软件正从静态代码集合变为“Living Software”,企业是其理想训练环境。还提及市场资金流向、多起企业投资合作事件,如英伟达投资英特尔、OpenAI租服务器等,最后介绍了ETF流动性相关知识。
苹果传统强项再发力,视觉领域三种模态终于统一
苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。