多模态视觉理解模型」共找到 1928 篇相关文章

产品应用7

14.9g颠覆行业,AI眼镜终于实现无感日常佩戴|甲子光年

在AI硬件浪潮中,AI眼镜被视为有潜力替代手机的形态。心眸科技发布的AI眼镜Moonix,重14.9克,回归眼镜本质,以“记录”为核心,具备主动式AI能力,能实现“记录 - 理解 - 分享”闭环。

甲子光年
算法论文7

CoT 之后,CoF 如何让帧间逻辑从「隐式对齐」变成「显式思考」?

CoT 虽提升语言模型推理能力,但在 C 端场景有局限,且被质疑并非真实推理。视觉领域提出 CoF 概念,Google DeepMind 团队引入理论,让视频模型通过帧链推理提升帧间一致性,还具强大泛化能力。

机器之心
开源动态8

重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!

传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B多模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于多场景。

开源星探
算法论文7

低延迟、高吞吐,LLM优化与高效推理引擎综述

LLM计算成本高,用户要低延迟,企业要高吞吐。工程师开发优化技术,如动态批处理、KV缓存、模型量化。论文对比25款推理引擎,还探讨了多模态支持、手机端推理、新型架构支持等进化方向。

深度学习自然语言处理
产品应用8

OpenAI 内部揭秘:我们如何使用 Codex

文章揭秘 OpenAI 内部使用 Codex 的情况,介绍其在理解代码、重构迁移、性能优化等多方面的应用场景,还给出最佳实践,如用‘提问模式’开始、组织好提示等,展现了 Codex 强大的开发辅助能力。

宝玉AI
产品应用8

最强AI PPT Skill!小白3分钟做大片感演示稿

本文介绍了鲸格PPT Skills,它是语义驱动的静态演示系统。区别于多数AI PPT工具,它先理解内容语义再呈现,支持多格式输出,有独特架构、动效和审美规则,生成的PPT可编辑、交互性强。

鲸选AI
算法论文8

视听分离SOTA提速6倍!清华发布首个6M高性能模型|ICLR'26

清华大学团队推出Dolphin模型,仅用6M参数,通过离散化视觉编码和热扩散注意力机制,实现单次推理精准分离语音,速度提升6倍以上,在多项基准测试中刷新纪录,为端侧设备部署开辟新路。

新智元
产品应用8

从顶级三甲到医疗巨头,他们为何都选择同一个AI“大脑”?

AI医疗迎来爆发,政策、技术、需求共振催生千亿蓝海。智诊科技WiseDiag医学多模态大模型成医疗企业破局关键,它有三大核心能力,适配多场景,还有低风险接入方案,现开放API免费试用。

AI寒武纪
新闻资讯7

Karpathy 评 DeepSeek-OCR:分词器必须消失!马斯克:光子才是 AI 的终极语言

Andrej Karpathy 发长文讨论 DeepSeek - OCR 论文,提出图像输入比文本更高效,还表达对分词器的厌恶,认为其必须消失。马斯克称 AI 主要交互将是视觉。开发者分享实践经验,也有人提出质疑。

AGI Hunt
产品应用8

腾讯王者归来:混元图像3.0登顶LMArena!一手实测全球最强图像AI

LMArena最新榜单显示,腾讯「混元图像3.0」在文生图任务中夺冠,碾压谷歌Nano banana和字节Seedream 4。它9月28日开源,性能对标闭源模型,有强大推理、语义理解能力,支持中英文长文本渲染。

新智元