「通用视觉感知系统」共找到 1584 篇相关文章
NVIDIA 开源 Live VLM WebUI:摄像头实时测试视觉语言模型
NVIDIA 开源 Live VLM WebUI,可让用户在本地用摄像头实时测试视觉语言模型。它基于 WebRTC 技术,能将摄像头视频流实时传输给模型,分析结果叠加在画面上,支持多后端、多平台及多种模型。
GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!
第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。
别人都在卷视觉,这家具身公司偏要卷“手感”
非夕科技坚持力觉优先路径研发具身智能,过去十年专注自研机械臂,产品应用广泛。此次推出Enlight初昕系列机械臂和MICO双臂机器人平台,还构建模块化产品生态,定位通用机器人基座平台,为具身智能落地打基础。
市值3055亿!摩尔线程敲钟,国产通用GPU第一股来了
国产通用GPU第一股摩尔线程今日敲钟上市,开盘价650元,较发行价高出469%,开盘市值超3055亿元。它88天过会创科创板纪录,将募资用于研发,收入结构转向AI智算领域。
视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K
视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。
视觉生成的另一条路:Infinity 自回归架构的原理与实践
本文整理自字节跳动韩剑在AICon 2025北京站的分享,以Infinity为例介绍自回归视觉生成原理,对比其与扩散模型,展示Infinity升级方案成果,它在高分辨率文本到图像任务能与扩散模型竞争。
LeCun和哈萨比斯「吵」起来了:「通用智能」到底存不存在?
LeCun 在播客称「通用智能」不存在,引发广泛讨论。Google DeepMind 掌门人 Hassabis 引用该帖硬刚,认为人类大脑和 AI 基础模型近似图灵机,有通用性。LeCun 回应强调这是数学事实,双方分歧反映对 AGI 发展路径的不同判断。
突发!曝阿里通义薄列峰离职,此前为应用视觉团队负责人
五一节后爆料阿里通义实验室应用视觉团队负责人薄列峰于4月30日离职。他曾带领团队做出爆款功能,现加入某互联网大厂。今年2月语音团队负责人鄢志杰也已离职,接替人选均成谜。
谢赛宁、李飞飞、LeCun联手提出多模态LLM新范式,「空间超感知」登场
纽约大学助理教授谢赛宁与李飞飞、Yann LeCun 合作提出「Cambrian - S」,迈出视频空间超感知探索第一步。该研究引入 VSI - Super 基准,还提出预测性感知范式,在空间认知任务上有提升,相关论文值得视频多模态研究者参考。
开源屏幕感知AI助手,快捷键即调,随时看懂屏幕上的一切!
日常Windows桌面工作调用AI助手常打断专注流。GitHub新开源工具Everywhere,能自动感知屏幕内容,快捷键即调,支持多模型,有网络搜索和Markdown渲染功能,多种场景适用。