视觉语言理解」共找到 2156 篇相关文章

产品应用8

开源的 skill 被抄了千赞,我用 Lovart 给自己做了个品牌!

作者开源剪辑 Agent 被抄赞多,决定为账号做品牌视觉。其非设计师,用 Lovart 改变与 AI 沟通方式,通过 Brand Kit、字体生成器等完成系列设计,还能导出 PSD,沉淀 Skill。

AI产品自由
算法论文8

ICLR 2026 | 别再让大模型“想太多”了!最新研究揭示 LLM 推理效率的关键瓶颈

语言模型推理计算成本失控,存在过度与思考不足问题。研究揭示推理失衡是根源,提出BAM模型及Plan - and - Budget框架,实验显示其能提升准确率与效率,转向‘推理价值’范式。

机器之心
新闻资讯8

2025 WAIC落幕,深谋科技异军突起,以技术与落地破局具身智能赛道

2025 WAIC落幕,深谋科技作为精英合作伙伴首次亮相,未随波逐流,而是切入脑控、动态视觉伺服和康养场景三大底层能力领域,开拓创新赛道。其产品已商用部署,吸引众多媒体关注。

AI科技评论
开源动态8

开源版MetaQuery来了!OpenUni用1.1B参数媲美BLIP3-o-8B,数据代码完全开源

南洋理工大学 S-Lab 和商汤科技团队推出开源版 MetaQuery——OpenUni,仅 1.1B 参数达 8B 模型性能,代码、权重、数据全开源。它架构极简、参数高效,还继承了多模态理解能力。

机器之心
产品应用8

OpenAI官方揭秘:我们这样用Codex写代码「7大核心用法、6条最佳实践首次公开」

本文基于对OpenAI工程师访谈和内部数据,汇编了Codex的7大核心用法,如代码理解、重构与迁移等,还给出6条最佳实践,展示其如何助力团队高效工作、提升质量及管理复杂性。

AI寒武纪
开源动态8

2天1k多星!BAGEL横空出世:字节跳动发布全球首个多模态全能AI,开启智能新纪元!

字节跳动推出开源多模态基础模型BAGEL,有70亿活跃参数。它在多模态理解排行榜超顶尖开源模型,文本到图像质量与SD3媲美,还具备世界建模等能力,文中介绍其方法、特性及使用说明。

GitHubStore
算法论文8

让机器人看视频学操作技能,清华等全新发布的CLAP框架做到了

近日,清华联合星尘智能、港大、MIT提出 CLAP 框架,能将视频运动空间与机器人动作空间对齐,解决‘数据饥荒’‘视觉纠缠’等问题,可让机器人从视频学技能,还缓解知识迁移难题,推动机器人产业化。

机器之心
推荐文章8

解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南

给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。

AIGC开放社区
算法论文8

天下武功,唯快不破:LLM高效架构最新最全面综述

大型语言模型虽成就辉煌,但训练成本高、推理延迟大,核心问题源于Transformer架构。这篇综述论文首次系统性梳理高效LLM架构创新方案,分类七大类方法,延伸至跨模态应用,为研究者提供‘效率蓝图’。

深度学习自然语言处理
推荐文章7

AI 行业最被低估的武器,是审美

AI竞赛激烈但产品趋同,品牌价值愈发重要。文章从品牌视角切入,阐述AI产品美学的三点基础洞察,梳理14个视觉标识趋势,还将品牌归为五类原型,强调品牌建设的重要性。

特工宇宙