语义空间解耦」共找到 746 篇相关文章

算法论文8

最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代

人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。

机器之心
新闻资讯8

具身导航,感知推理到底是「上帝」,还是执行控制是「命门」?| GAIR Live 023

本文是GAIR Live 023圆桌对话实录,浙江大学彭思达与具身多模态算法专家郝孝帅探讨具身导航。涉及本质、范式、挑战、交互等方面,还对未来5 - 10年发展做了展望。

AI科技评论
新闻资讯7

GPT-5正以o3的三倍速度打宝可梦,现已抵达冠军之路,直播进行中

GPT - 5直播独立运行宝可梦红版,速度比o3快近三倍,6105步抵达冠军之路,而o3需16882步。原因是其幻觉少、空间推理和规划能力强。直播已进行9小时,超2000人关注,OpenAI总裁点赞。

AGI Hunt
产品应用7

Grok4全网玩疯,成功通过小球编程测试,Epic创始人:这就是AGI

发布不到一天,Grok4就被网友玩疯。它通过六边形小球编程测试,动画表现出色。大佬Tim Sweeney称其为AGI,马斯克附议。还有网友用多种方式测试,如与o3对比、SVG绘图等,Grok4表现有亮点。

量子位
产品应用8

波士顿动力机器人进厂打工现逆天操作!3D感知+实时追踪,人类捣乱完全不带怕的

波士顿动力的Altas机器人重磅升级,具备3D空间感知和实时物体追踪能力,可自主执行复杂工业任务。文章还解析其背后技术,包括2D感知、3D感知、物体位姿估计和校准等,团队未来将构建统一基础模型。

量子位
开源动态7

一键式训练端到端Agent,Qwen3+MCP工具集高效集成!

RLFactory是开源的端到端RL后训练框架,将环境与RL后训练解耦,有极致易用、高效训练等特点。它让用户专注奖励逻辑和工具配置,还能提升训练效率,用Qwen3和MCP工具可快速训练DeepSearch模型。

GiantPandaLLM
算法论文8

深入感知级别图像理解:UniPercept 统一图像美学、质量与结构纹理感知

多模态大语言模型在语义级任务表现卓越,但在感知级图像理解有短板。上海人工智能实验室等机构联合发布 UniPercept,构建感知属性定义系统与基准测试集,训练强基准模型,在多方面表现超现有顶尖模型,应用潜力大。

机器之心
新闻资讯8

GAIR 2025 世界模型分论坛:从通用感知到视频、物理世界模型的百家争鸣

第八届GAIR全球人工智能与机器人大会世界模型分论坛上,五位青年学者围绕世界模型展开精彩演讲,话题涵盖通用感知、三维技术等。他们的研究为世界模型领域带来不同启发,目前该领域研究尚处起步阶段,共识未形成。

AI科技评论
算法论文8

用「传心术」替代「对话」,清华大学联合无问芯穹、港中文等机构提出Cache-to-Cache模型通信新范式

随着大语言模型发展,多智能体系统中现有T2T交流方式有信息丢失、语义模糊、延迟大问题。清华等团队提出C2C信息传递方式,以KV - Cache为媒介,提升了正确率和速度,还介绍了实现路径、优势及应用前景。

机器之心
算法论文7

3D-R1重塑三维视觉语言推理!让三维交互更智能

近年来,视觉 - 语言模型在2D图像理解有突破,但3D视觉语言模型面对复杂场景不足。为此上海大学团队提出3D - R1模型,它基于新数据集和策略构建,有强多任务三维理解能力,不过也存在进步空间

带你学AI