通用多模态推理」共找到 3287 篇相关文章

算法论文8

零样本&少样本横扫12个工业医疗数据集:西门子×腾讯优图新研究精准定位缺陷,检测精度新SOTA丨AAAI 2026

西门子与腾讯优图联合团队提出AdaptCLIP通用视觉异常检测框架,不改动CLIP主干,引入轻量适配器。它兼容零样本/少样本推理,在12个数据集评估表现优,兼顾精度与部署需求。

量子位
开源动态8

首个开源多模态Deep Research智能体,超越多个闭源方案

首个开源多模态Deep Research Agent登场,整合多种工具并优化决策。其WebWatcher技术方案覆盖全链路,实验中在四大核心领域领先主流模型,展现复杂推理和信息检索实力。

量子位
新闻资讯8

OpenAI深夜祭出GPT-5.4,暴击Claude!原生操控电脑,打工人悬了

OpenAI发布GPT - 5.4,全面反击Gemini 3.1 Pro和Claude Opus 4.6。它是首个有「原生电脑使用」能力的通用模型,各维度无短板,成绩炸裂,定价也创新高。

新智元
产品应用7

把 Nano Banana/Gemini 3 Pro 榨干!这几点你必须知道

Gemini 3 放出 Pro 和 Nano Banana Pro 两条线,前者主打长上下文、多模态推理,后者专攻像素级生成。文章提炼精髓,给出“通用 + 像素”双模实战笔记,介绍两者使用要点及创意场景实测。

PaperAgent
新闻资讯7

“iFold”,苹果AI新成果

苹果发布基于流匹配的蛋白质折叠模型SimpleFold,被戏称“iFold”。它用通用Transformer模块搭配流匹配生成范式,3B参数版本追平谷歌AlphaFold2性能,还解决了传统模型算力依赖问题,效率高。

量子位
推荐文章7

评论送书 | Al智能体与传统AI应用的区别?它如何工作?如何快速构建智能体?

文章对比AI智能体与传统AI应用,指出前者更像“乐高积木”,可融入生活工作。介绍其工作是“感知—推理—执行—学习”循环,还给出快速构建通用方法,如明确目标、选框架等。

AIGC开放社区
新闻资讯7

视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒

谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出图快且便宜。二者串联使用,图像生成与视频创作可无缝衔接。

量子位
产品应用8

中国AI Agent产业化参考范本:斑马口语攻克的四大技术难关

2025年AI产业转折,通用大模型落地难,垂直场景成关键。斑马口语作为垂直落地的AI Agent,突破实时交互、语音识别、内容适龄、多模态呈现四大技术难关,为中国AI Agent产业化提供范本。

机器之心
新闻资讯8

英伟达Jim Fan:「世界建模」是新一代预训练范式

英伟达机器人主管Jim Fan判断,继“下一个词预测”后,世界建模将成新预训练范式,2026年大世界模型将为多模态AI奠基。他还讨论世界模型定义、应用,展望新推理形式,业内人士也各抒己见。

量子位
算法论文8

让大模型“边看边改”,视觉分割准确率直接上涨9% | ICML 2026

复旦、创智联合推出RSAgent,让多模态大模型通过多轮工具调用生成准确掩码,解决视觉分割难题。该工作入选ICML 2026,实验显示其在多个测试集上表现领先,还展示了从‘看图问答’到‘视觉行动’的路径。

量子位