多视图输入」共找到 4263 篇相关文章

开源动态8

性能比肩DeepSeek-R1,MiniMax仅花380万训出推理大模型性价比新王|开源

MiniMax开源推理大模型MiniMax - M1,原生支持100万token输入、8万输出,性能比肩DeepSeek - R1,仅花380万训成。采用Lightning Attention机制与CISPO算法,在领域表现出色,模型权重可在HuggingFace下载。

量子位
开源动态8

Meta开源Muse Glimmer,30B Agent小钢炮跑进你的电脑

Meta发布并以宽松协议开源Agent模型Muse Glimmer。它30B参数,能跑在Mac或PC上,项Agent基准领先。可完成端到端任务、调用工具及步推理,接受文本与图像交错输入,用途广泛。

AIGC开放社区
产品应用8

谷歌新模型登顶Nature,人类基因密码被解码

谷歌推出全新AI工具AlphaGenome,能精准预测人类DNA序列变异对调控基因生物过程的影响。它满足项条件,在26个变异效应benchmark中25个达SOTA,还通过个案例和实验验证了其性能。

PaperAgent
开源动态8

空间智能新作,影石开源户外全景重建算法

近日,Insta360 研究院联合高校提出 PanoLOG,首个面向全景输入的大规模户外三维重建工作。它解决全景分区难题,在基准上取得领先渲染质量与小模型体积,还为户外具身智能等提供新思路。

机器之心
产品应用8

Google Gemini Embedding2:一个模型处理所有媒体类型

Google发布Gemini Embedding 2,首个原生模态嵌入模型。能处理文本、图像等种媒体类型,支持交错输入,覆盖超100种语言。与模型串联方案比,延迟降70%、召回率升20%。已可在Gemini API等使用。

AI工程化
开源动态7

MIDAS:快手可灵发布实时交互式数字人生成框架

近年来交互式数字人视频生成受关注,但实时处理模态输入有挑战。快手可灵团队提出MIDAS框架,基于LLM驱动的自回归模型,结合轻量级扩散头,实现低延迟、交互式模态控制,还构建大规模数据集等。

带你学AI
开源动态8

Qwen3-VL-Embedding系列上新:探索统一模态表征与排序

2025年6月曾开源Qwen3-Embedding和Qwen3-ReRanker,现推出Qwen3-VL-Embedding和Qwen3-VL-Reranker。它们基于Qwen3-VL构建,能处理模态输入,在任务达业界领先,还介绍了特性、评测及使用方法。

通义千问Qwen
开源动态8

一周10来个模型被开源,阿里Qwen杀疯了~

阿里通义千问这周开源众模型,如Qwen3 - Omni、Qwen - Image - Edit等,涉及全模态、图像编辑、安全审核等领域。各模型能力出色,如Qwen3 - Omni能处理模态输入,Qwen3 - VL表现超部分闭源模型。

PaperAgent
开源动态8

美团开源全模态,比肩顶级闭源模型,开源新SOTA

美团LongCat团队发布5600亿参数开源全模态模型LongCat - Flash - Omni,它有端到端全模态架构,能实现毫秒级实时音频 - 视觉交互。该模型训练采用渐进式策略,工程上有高效技术支撑,在基准测试表现出色。

AIGC开放社区
产品应用8

3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!

文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。

CourseAI