多模态大语言模型」共找到 8054 篇相关文章

算法论文8

POF | 上海理工大学梁梓浩、朱兵等:使用大语言模型进行气泡湍流实验数据处理

本文提出结合大语言模型(Time - LLM)与Transformer模型的复合框架处理气泡两相流热膜测量信号干扰。先由Time - LLM识别气泡干扰信号,再用Transformer模型修复。实验证明该方法高效、轻量且物理自洽。

力学与人工智能
新闻资讯8

编码器-解码器架构的复兴?谷歌一口气发布32个T5Gemma模型

谷歌在xAI吸引眼球时更新Gemma系列模型,发布多模态模型MedGemma,还一口气推出32个T5Gemma模型。该模型基于适应技术,性能表现佳,引发编码器 - 解码器架构复兴讨论。

机器之心
新闻资讯7

神秘模型「Pony Alpha」引外网热议,它会是国产大模型中的谁?

近日,全球模型服务平台OpenRouter上搜索第一的神秘模型「Pony Alpha」引外网热议,它是新一代通用大模型,在多方面表现突出且可免费使用。网友、AI猜测其身份众说纷纭,已有人用它做出惊艳案例。

机器之心
开源动态8

一周10来个模型被开源,阿里Qwen杀疯了~

阿里通义千问这周开源众多模型,如Qwen3 - Omni、Qwen - Image - Edit等,涉及全模态、图像编辑、安全审核等多领域。各模型能力出色,如Qwen3 - Omni能处理多模态输入,Qwen3 - VL表现超部分闭源模型

PaperAgent
算法论文8

DeepMind率先提出CoF:视频模型有自己的思维链

DeepMind在Veo 3论文中提出帧链CoF概念,类比语言模型CoT,让视频模型能时空推理。实验显示Veo 3有通用视觉理解能力,能零样本解决视觉任务,未来通用视频模型或取代专用模型

量子位
开源动态7

字节开源了一个了不得的模型

字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。

探索AGI
算法论文7

SSM+扩散模型,竟造出一种全新的「视频世界模型

在AI热词不断涌现的时代,斯坦福大学等机构研究将长上下文、状态空间模型、扩散模型等结合,创造全新「视频世界模型」。它用状态空间模型实现长期记忆,还设置局部注意力机制,训练和推理表现出色。

机器之心
算法论文8

知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳

东南大学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三大知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。

量子位
开源动态8

刚刚,最佳VLA模型GigaBrain-0开源:世界模型驱动10倍数据,真机碾压SOTA

近日,极佳视界与湖北人形机器人创新中心联合发布端到端VLA具身基础模型GigaBrain - 0,这是国内首个用世界模型生成数据实现真机泛化的模型,后续将全面开源,能完成复杂操作,实验成功率超SOTA方法。

新智元
算法论文8

Meta超级智能实验室又发论文,模型混一混,性能直接SOTA

语言模型训练依赖算力和时间,传统模型 Souping 多采用均匀平均。Meta 等研究者提出类专家 Soup(SoCE),利用基准测试类别构成选最优模型,非均匀加权平均,实验显示其提升了模型效果与稳健性,在排行榜获 SOTA 成绩。

机器之心