视觉 - 语言推理」共找到 3214 篇相关文章

算法论文8

端到端智驾新SOTA | KnowVal:懂法律道德、有价值观的智能驾驶系统

北京大学王勇涛团队提出新型自动驾驶系统 KnowVal,通过感知与知识检索模块协同实现视觉 - 语言推理。它构建驾驶知识图谱,有价值模型用于轨迹规划,实验在多基准测试表现佳,还通过定性分析验证效果。

机器之心
开源动态8

SmolVLA: 让机器人更懂 “看听说做” 的轻量化解决方案

文章介绍轻量级开源视觉 - 语言 - 动作 (VLA) 模型 SmolVLA,专为机器人领域设计,可在消费级硬件运行。它用公开数据集训练,架构经优化,还引入异步推理堆栈,性能超部分大模型,降低研究门槛。

Hugging Face
开源动态8

41个榜单SOTA!智谱最新开源GLM-4.5V实测:看图猜地址、视频秒变代码

智谱基于GLM - 4.5打造的开源多模态视觉推理模型GLM - 4.5V,在42个公开榜单中41项夺得SOTA。其功能丰富,玩法升级,还为企业与开发者提供高性价比方案,是100B参数级SOTA标杆。

新智元
开源动态8

刚刚,智谱开源了他们的最强多模态模型,GLM-4.5v。

智谱接连开源GLM - 4.5和GLM - 4.5V,后者为多模态模型,总参数106B,在42个评测基准中41个达到SOTA。经测试,它视觉推理强、速度快,还有视频理解等功能,API定价良心,体现持续开放精神。

数字生命卡兹克
算法论文8

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

AI视频生成技术发展迅速,现有检测方法难满足需求。最新综述提出「事实保真度验证」目标,梳理出视觉语言双视角的四层检测框架,还分析了检测方法演进、评测指标和数据集,为AI视频检测提供落地地图。

新智元
产品应用7

The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者

Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。

DeeplearningAI
推荐文章7

为什么我觉得AGI并不会马上到来

作者Dwarkesh Patel认为AGI不会马上到来。当前大语言模型缺乏持续学习能力,难以替代人类工作;计算机操作能力受训练周期、数据等限制;推理能力虽有突破,但仍需时间发展。作者给出了具体预测时间。

宝玉AI
产品应用8

DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理

DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。

AIGC开放社区
新闻资讯8

ImageNet作者苏昊被曝任教复旦

ImageNet作者之一苏昊被曝要去复旦任教。他是具身智能领域论文被引次数最高的华人学者,主导多个奠基级项目。他研究从语言到2D、3D视觉,再到机器人,还创办具身智能公司Hillbot。

量子位
产品应用8

ChatGPT Images 2.0震撼发布!碾压谷歌Nano Banana,设计真要完了

北京时间凌晨3点,OpenAI发布ChatGPT Images 2.0,是先进模型,能处理复杂视觉任务。它精度控制力高、多语言能力强,风格表达成熟,支持多种宽高比,有现实世界理解能力等,已向相关用户开放,但也有局限性。

机器之心