多模态LLM」共找到 1855 篇相关文章

产品应用7

季度AI视频生成产品:多模态输入成标配,角逐一站式生成能力 | 量子位智库AI 100

Sora2下载量破百万引发AI视频生成热潮,谷歌推出Veo3.1再掀高潮。国外大厂将其卷至电影制作级创意,国内企业追求高质量、秒级生成并落地垂直场景。量子位智库发布的产品呈现多维度技术演进。

量子位
算法论文8

突破Pass@1瓶颈:一种让LLM自我博弈、永不枯竭的RL新范式,超越基线22.8%!

近年来,基于可验证奖励的强化学习(RLVR)在提升大型语言模型(LLM)推理能力上有关键作用,但存在熵崩溃问题。论文提出SVS创新策略,让模型自我合成变分问题形成自我提升循环,实验效果惊人。

深度学习自然语言处理
产品应用8

杀疯了!单卡4090跑通全量微调,面壁1B级多模态性能怪兽硬刚大厂

面壁智能推出MiniCPM-V 4.6,参数约1B,性能和推理效率出色。它在多模态任务综合能力、推理速度上领先竞品,靠ViT架构改造和4倍/16倍混合视觉Token压缩实现创新,有工业验证,对开发者和普通用户意义大。

AI寒武纪
开源动态8

完全开源的7B模型,性能比肩主流LLM,训练成本仅16万美元,复现DeepSeek的强化学习!

Moxin-7B由多机构团队联合开发,遵循“开源科学”原则,公开全流程细节。它训练成本仅16万美元,评测表现亮眼,在架构、数据策略、训练过程等方面有创新,为中小企业提供可控AI方案。

AI科技大本营
开源动态8

字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。

字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。

GitHubStore
算法论文8

统一视觉多模态与多任务!快手可灵与港科大团队发布视频生成模型,加速真实世界理解

港科大、港中文、清华和快手可灵团队提出全新视觉框架UnityVideo,统一训练多种视觉模态,让模型更懂物理规律,视频生成更真实可控,还实现零样本泛化,在多任务表现优异。

量子位
算法论文8

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。

机器之心
开源动态8

社区供稿 | 全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型 Intern-S1 | WAIC 2025

7月26日,上海AI实验室在WAIC 2025上发布并开源科学多模态大模型Intern-S1。它融合书生家族优势,首创跨模态科学解析引擎,在多学科任务上超越顶尖闭源模型,技术创新显著,未来将持续开源。

Hugging Face
新闻资讯7

OpenAI华人AI大牛集体跳槽Meta!清华北大浙大中科大校友各一位,多模态后训练、感知团队负责人全走了

扎克伯格从奥特曼手里挖走4名OpenAI华人顶尖AI人才,包括中科大、浙大、清华、北大校友各一位。OpenAI或提高薪酬留人,人才争夺战成本升高,这也是开源与闭源阵营的交锋。

量子位
开源动态8

全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型Intern-S1 | WAIC 2025

7月26日,上海AI实验室在WAIC 2025上发布并开源『书生』科学多模态大模型Intern-S1。它首创‘跨模态科学解析引擎’,在多学科专业任务基准上超越顶尖闭源模型,还具备体系化技术创新。未来将持续开源,打造更懂科学的AI助手。

GiantPandaLLM