原生多模态推理」共找到 3072 篇相关文章

算法论文8

AAAI 2026 Oral | 大模型「爱你在心口难开」?深度隐藏认知让推理更可靠

合肥工业大学团队提出大模型存在‘隐藏的真伪认知’,论文让模型用此给推理‘打分’,过滤错误推理链。通过多层注意力头探测、构建预测器和新推理扩展策略,提升了推理链稳定性,实验效果优异。

机器之心
算法论文8

「Thinking with Images」推理速度太慢?「Zooming without Zooming」 让AI不调用工具也能「明察秋毫」!

上海交通大学与蚂蚁集团联合团队发布多模态大模型成果“Zooming without Zooming”。该研究提出R2I方法,将“缩放”转为训练目标,使模型单次前向传播实现细粒度感知,团队开源的ZwZ模型家族达开源SOTA性能。

AI科技评论
产品应用8

比英伟达早,比李飞飞强,大晓Kairos原生一体化世界模型定义物理AI新路线

大晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四大权威具身智能基准上全面登顶。

机器之心
开源动态8

一张4090就能爆改!面壁智能MiniCPM-V 4.6开源,1B多模态卷出新高度

今年是AI应用大规模落地年,参数小的端侧模型有特定场景性能优势。5月11日面壁智能开源MiniCPM-V 4.6,参数仅约1B,多模态能力超阿里、谷歌同类模型,还在多维度提升,站稳端侧多模态开源领域。

机器之心
开源动态8

抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT-4o

抖音SAIL团队与LV - NUS Lab联合推出多模态大模型SAIL - VL2,以中小参数规模在106个数据集实现性能突破。该模型从架构、数据、训练三方面创新,后经全链路优化,在多数据集验证中表现卓越。

量子位
开源动态8

刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!

小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。

新智元
开源动态8

AI秒懂短视频,快手大模型Keye-VL理解力爆表!技术细节全开源

快手全新多模态大语言模型Kwai Keye-VL上线且开源,能深度融合多模态信息,在视频理解、复杂视觉感知和逻辑推理上表现优异。介绍了其技术架构、预训练和后训练策略及训练架构优化等内容。

新智元
开源动态8

腾讯开源混元世界模型1.1,视频秒变3D世界,单卡推理仅需1秒

腾讯发布并开源混元世界模型1.1,是统一的端到端3D重建基座大模型。它支持从多视图或视频一键生成3D世界,单卡秒级推理完成高精度重建,性能达SOTA,还具多特性,打破技术壁垒。

量子位
新闻资讯8

GPT-5.1发布当天,文心5.0杀回来了

2025百度世界大会发布文心5.0,这一2.4万亿参数的原生全模态模型,训练之初融合多模态数据,支持联合输入输出。同日OpenAI推出GPT - 5.1,文心5.0在多方面表现出色,如情绪安抚更贴心、多模态理解能力强等。

新智元
产品应用7

DeepSeek识图模式是个新模型?!一手实测在此(没错我被灰度到了)

作者喜提DeepSeek识图模式灰度测试,实测发现其非思考模式速度快,推理有幻觉;思考模式推理慢且冗长。实用功能如OCR、复原HTML较靠谱,但色盲测试偶翻车。该模式或用独立视觉模型,且多模态进展超预期。

量子位