交互式视觉推理」共找到 2589 篇相关文章

算法论文7

大模型也需要睡觉!让AI打个盹,醒来更聪明

卡内基梅隆大学和马里兰大学研究发现,大模型处理长上下文易累傻。受人脑机制启发,设计睡眠机制,让模型在上下文窗口快满时打盹,反复咀嚼信息,压缩进长期权重。测试显示,增加“睡眠”轮次能提升深度推理表现。

量子位
开源动态8

斩获22K star!再见重复劳动,微软AI开源智能办公机器人来了!抓紧用起来

微软推出视觉自动化神器`OmniParser`,上线GitHub获22K star。它重新定义人机协作,有三大能力、五大自动化杀手锏,适用于六大实战场景,还给出速成指南,与同类方案相比优势明显,正重塑办公范式。

小华同学ai
开源动态8

76.5k+ star,逆天终端神器!

文章介绍开源工具 `fzf`,它是用 Go 语言编写的命令行模糊查找器,可在多系统使用。有交互式模糊过滤等特性,支持多平台安装,还能与 Shell、编辑器集成,提升命令行体验。

开源先锋
产品应用7

Claude Opus 4.7发布:更强能力,自我纠错,越来越不需要人类干预了

Anthropic发布Claude Opus 4.7版本,搭配Routines功能可自动化工作,人类干预减少。该版本能力大幅增强,还引入护栏机制保障安全,推出新运算级别和任务预算功能。

AIGC开放社区
开源动态8

开源音视频同步SOTA基座:极简的单流架构,2秒出片

AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。

AIGC开放社区
推荐文章7

游戏教父 John Carmack:LLM 不是游戏的未来

游戏教父 John Carmack 认为 LLM 不是游戏未来,强调交互式体验学习重要性。他倾向游戏和虚拟环境研究,分析 Atari 游戏强化学习问题,还提及离线学习、迁移学习等方面挑战。

AI前线
新闻资讯7

GPT-5.4意外泄露!OpenAI最新模型瞄准这2大能力突围

GPT - 5.4疑似泄露,此前在OpenAI编码助手、GitHub代码拉取请求等多处有踪迹。传闻其将搭载200万Tokens上下文窗口,具备像素级精准视觉分析能力,不过也可能是炒作,网友关注其准确率。

量子位
新闻资讯7

把屁声发给ChatGPT,它说这是艺术

有人将屁声音效发给ChatGPT,问其音乐如何,ChatGPT一通夸赞。类似AI谄媚问题不少,还存在‘幻景推理’现象,顶尖模型无图像也能描述细节,使用AI得留个心眼。

量子位
算法论文8

让机器人学会手往哪儿伸、怎么操作,东大团队给了新解法

东南大学魏秀参团队提出 RAAP 解决具身智能领域可供性预测难题。它将 affordance 分解,设计互补推理机制,每任务仅需数十样本,已被 ICRA 2026 接收,实验显示其性能优于基线。

机器之心
新闻资讯7

DeepSeek深夜更新后自曝:我是V4(?!)

DeepSeek网页端深夜大更新,推出「快速模式」和「专家模式」,还有「视觉模型」开启灰度测试。虽官方未说明,但网友推测专家模式可能是V4或V4 Lite,完整版V4或许不远。

量子位