视觉大模型」共找到 9269 篇相关文章

算法论文8

CVPR2026 | Streamo:让模型变成实时流式交互助手

香港浸会学联合腾讯优图实验室提出 Streamo,将‘何时回答’变为模型预测的 token,通过端到端训练框架把离线视频模型转化为实时流视频助手,还构建 Streamo - Instruct - 465K 数据集,实验效果良好。

机器之心
产品应用8

360发布全球最强视觉语言对齐模型!榜单全面领先!

360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。

AIGC开放社区
算法论文8

为什么模型会产生幻觉?OpenAI最新研究终于搞清楚了

OpenAI发布研究论文剖析LLM幻觉根源,指出当前主流训练与评估体系是核心驱动因素之一。现行评估奖励猜测行为,幻觉起源于预训练的‘下一词预测’,论文还澄清五误区,建议改革评估体系。

AI寒武纪
产品应用7

豆包也开始抢程序员饭碗了,首个编程模型来了!

字节给豆包升级编程能力,推出首款编程模型Doubao - Seed - Code。它刷新国内编程模型上下文长度,支持视觉理解,API价格良心。经测试,虽未达全球顶尖,但弥补国产编程模型短板。

开源星探
开源动态8

蚂蚁抛弃向量推荐!用8B小模型构建「用户“话”像」,实现跨模型通用并拿下SOTA

2026年AI开发者关注爆款模型应用,个性化是关键。蚂蚁集团和东北学团队推出AlignXplore+,实现文本化用户建模新范式,有全域通用、极致迁移、实战适配特性,小参数超越基线,未来将继续探索。

量子位
算法论文8

DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角

DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。

AI寒武纪
开源动态8

Anthropic祭出模型“读脑”杀手锏:LLM决策过程全给你扒开看

Anthropic宣布开源电路追踪工具,可追踪LLM神经元,通过生成“归因图谱”揭示模型输出原因。开源了生成图谱的库和交互式前端,并提供demo notebook。可追踪电路、可视化图谱、检验假设。

AI寒武纪
开源动态8

Claude团队打开模型「脑回路」,开源LLM思维可视化工具来了

Claude团队推出“电路追踪”工具,可生成归因图呈现LLM处理信息路径,支持在主流开源权重模型上快速生成。研究人员能借此解码LLM“决策逻辑”,官方还给出多语言电路等示例。

量子位
推荐文章7

深度长文解读 “世界模型” :在虚构与真实交接之处凝视未来

本文深入解读“世界模型”,虽无明确定义,但从目的出发分为表征和生成两类。前者含生物脑、视觉和语言中心预测;后者有基于规则模拟和数据驱动生成。还探讨LLM是否为世界模型,指出各类模型相辅相成。

AI科技评论
算法论文8

Qwen3-VL-Seg 深度解读:当多模态模型学会"像素级精准手术",仅用0.4%参数碾压8B模型

文章深度解读阿里通义实验室发布的Qwen3-VL-Seg,它解决开放世界指代分割问题,用仅17M参数(占基础模型0.4%)在4B规模超越8B模型。介绍其原理、架构、数据、实验结果,还给出实战代码。

机器学习AI算法工程