图像推理」共找到 2403 篇相关文章

开源动态8

GLM4.5之后,智谱又开源GLM-4.5V,实测下来视觉推理能力贼强~

智谱继GLM4.5后又开源GLM - 4.5V,它是同级别开源SOTA视觉推理模型,在多模态理解榜单表现优异。文章实测其在科研全生命周期的应用,还介绍了模型架构设计和训练策略。

PaperAgent
算法论文8

从显式CoT到隐式CoT:复旦让AI告别啰嗦,实现大模型高效沉默推理

复旦大学等机构团队论文提出SIM - CoT技术,解决隐式思维链推理准确率低、不稳定问题。该技术引入步骤级监督,提升性能、效率和可解释性,在多模型和任务测试中表现出色,让大模型高效沉默推理

AIGC开放社区
算法论文8

不改模型也能提升推理性能?ICLR投稿提出测试时扩展新范式OTV

ICLR 2026投稿论文提出单token验证(OTV),是测试时扩展新机制,让模型能边推理边判断正误。它基于并行思考思路,借助轻量内部验证器分析推理过程,实验显示其性能优于主流方法。

量子位
开源动态7

强迫模型自我争论,递归思考版CoT热度飙升!网友:这不就是大多数推理模型的套路吗?

近日,概念CoRT火了,它在CoT基础上加了“递归思考”,能让AI递归思考响应、生成替代方案并选最优,结合“结构化自我批判”提升推理力。不过网友质疑它是“新瓶装旧酒”。

机器之心
推荐文章7

2025.7.4上午 | 视觉智能驱动的多模态对齐与推理的近期系列工作分享 - 复旦博士生王思尹

本次分享由复旦博士生王思尹围绕‘视觉智能驱动的多模态对齐与推理’展开,介绍多模态大模型探索研究,涉及跨模态组合语义理解、视觉参与推理及基于视觉建模世界完成行动等内容。

深度学习自然语言处理
产品应用8

AI真有希望考清北了!豆包1.6多模态推理发威,闯关数理化带图大题

火山引擎原动力大会发布豆包大模型1.6,它是国内首款多模态SOTA模型,支持256k上下文长度。实测中它解答高考数理化带图大题表现出色,还具备图像识别、视频理解、GUI操作等能力。此外,火山引擎还推出系列工具和平台助力企业。

新智元
算法论文8

NeurIPS25高分论文|以判别式监督学习强化推理LLM,解决难度偏差和熵崩塌难题

德州农工大学博士生李港在NeurIPS25高分论文中,分析GRPO优化目标,发现难度偏差局限及与判别式监督学习联系,提出DisCO框架强化大型推理模型,其优势显著,实验表现优于GRPO及其变体。

机器之心
算法论文8

一句话生成无限逼真3D场景!匹兹堡大学新作直击VLM空间推理软肋丨CVPR'26

VLM在3D空间推理上表现不佳,且缺乏合适测试基准。匹兹堡大学团队提出InfiniBench框架,用LLM Agent迭代优化和聚类策略,可按需生成3D场景,还能精准定位大模型空间推理缺陷。

量子位
新闻资讯7

独家 | CMU博士、UCSD助理教授黄碧薇创立「原识之智」,聚焦因果推理方向

AI科技评论独家获悉,CMU博士、UCSD助理教授黄碧薇创立上海原识之智科技有限公司,切入具身智能基础层相关的因果推理方向。当下大语言模型在符号世界表现出色,而机器人缺乏因果推理能力,原识之智项目已获顺为资本早期投资。

AI科技评论
产品应用8

谷歌最强AI图像模型Nano Banana 100+精选案例,商业级 AI 创意图集!附高清Prompt

Awesome-Nano-Banana-images收集Nano-banana在各任务场景生成的惊艳图片与提示词,展示Google图像生成与编辑无限可能。文中列举插画变手办、根据地图箭头生成图片等110个案例及对应输入和提示词。

AI Reading Hub