多模态语言模型」共找到 8067 篇相关文章

产品应用8

比英伟达早,比李飞飞强,大晓Kairos原生一体化世界模型定义物理AI新路线

大晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四大权威具身智能基准上全面登顶。

机器之心
开源动态8

首个面向科学任务、真实交互、自动评估的多模态智能体评测环境,ScienceBoard来了

ScienceBoard是首个面向科学任务、真实交互、自动评估的多模态智能体评测环境。它集成多领域科研软件,构建科研任务集合,评估智能体在科学任务上的表现,发现现有模型在科研工作流中远未成熟。

机器之心
开源动态8

谷歌痛失王座?港科大贾佳亚团队DreamOmni2开源,超强P图暴击Nano Banana

港科大贾佳亚团队开源DreamOmni2,该模型基于FLUX Kontext,能处理多参考图像,在多模态编辑与生成上表现出色,超越谷歌Nano Banana等模型,还构建了新测试集与数据构建范式。

新智元
算法论文8

谷歌的DeepSeek时刻:LLM推理加速被干到了8倍

谷歌TurboQuant论文介绍量化算法,能为大语言模型和向量搜索引擎大规模压缩。可将大语言模型KV缓存内存减至少6倍、加速达8倍且精度零损失,还介绍其工作原理及实验结果。

PaperAgent
开源动态8

ICML 2025 | 长视频理解新SOTA!蚂蚁&人大开源ViLAMP-7B,单卡可处理3小时视频

在视觉语言模型取得突破的当下,长视频理解挑战凸显。蚂蚁和人大团队提出视觉语言模型ViLAMP,采用‘混合精度’策略,在多基准测试中超越现有方案,单卡可处理3小时视频,为实际应用带来新可能。

机器之心
开源动态8

Jina Code Embeddings: 为高质量代码搜索而生的0.5B/1.5B向量模型

本文介绍了 Jina AI 开源的代码向量模型 `jina-code-embeddings`,含 0.5B 和 1.5B 规模,有 GGUF 量化版本。它性能顶尖,支持多任务与 15 种语言,还介绍了训练方案、使用方法等。

Jina AI
新闻资讯7

亏到发疯!AI编程独角兽年入2亿8,结果用户越多亏得越狠

TechCrunch调查发现,AI编程公司虽收入和估值高,但普遍亏损。其运作成本高,大语言模型调用费占大头,用户越多成本越高,且市场竞争激烈。公司尝试自研模型、被收购、降价、提价等方法扭亏。

量子位
产品应用7

视频进入可编辑时代:藏师傅教你视频版 Banana 可灵 O1

可灵发布大一统视频、图像生成和编辑工具 O1,支持在一个界面完成视频图片编辑生成。此次更新统一多模态视频大模型,支持多模态输入,有诸多新特性,还支持自由选择视频生成时长和风格转换等。

歸藏的AI工具箱
开源动态8

美团新独立APP,点不了菜只能点AI

美团新开源LongCat-Flash-Omni模型,支持多模态,在全模态基准测试达开源SOTA水准,推理快且全模态能力强。实测交互体验丝滑,其迭代逻辑清晰。该模型成功源于架构创新,美团靠软硬件结合实现虚实连接。

量子位
新闻资讯8

一场文心大模型的「AI马拉松」

2025 年模型能力至关重要,百度在基础模型研发持续投入。百度 AI Day 上,吴甜解读文心新模型技术,文心 X1 Turbo 推理强、成本低。百度技术体系完备,未来看好多模态与智能体,降成本促应用生态发展。

机器之心