视觉系统」共找到 2279 篇相关文章

算法论文8

统一视觉多模态与多任务!快手可灵与港科大团队发布视频生成模型,加速真实世界理解

港科大、港中文、清华和快手可灵团队提出全新视觉框架UnityVideo,统一训练多种视觉模态,让模型更懂物理规律,视频生成更真实可控,还实现零样本泛化,在多任务表现优异。

量子位
算法论文8

ICLR 2026 | 当视频难以被表征:UCSD、HKUST等机构联合提出FlowRVS,用生成式流匹配重构视觉感知范式

计算机视觉领域传统表征方法在视频处理上力不从心,SGIT AI Lab等机构团队提出FlowRVS,跳出传统桎梏,用生成式流匹配重构视觉感知范式,实现SOTA提升,还展现诸多优势,证明Flow Matching理论普适性。

机器之心
算法论文8

只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max

现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。

机器之心
推荐文章8

从实践到原则:为 AI Agent 构建的 Harness Engineering 落地与探索

生成式 AI 进入软件开发核心流程,但 AI 写代码速度超团队控复杂度能力。问题不在模型,而在软件工程系统。Harness Engineering 试图解决此问题,从三层面重新设计工程系统,已有公司实践。

phodal
算法论文8

模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作

北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。

机器之心
新闻资讯8

帮大家总结了一下凌晨的Google I/O 2026开发者大会。

本文总结Google I/O 2026开发者大会成果,涵盖AI模型、产品、Agent系统视觉生成、搜索、电商等多领域。如推出Gemini 3.5 Flash,升级产品功能,发布新Agent系统,推进电商协议,还有科研成果与硬件更新。

数字生命卡兹克
算法论文8

浙大推出首个「多图应用题」基准GSM8K-V,全面评估 VLM数学推理能力

浙江大学团队推出视觉数学推理基准GSM8K-V,将GSM8K映射为视觉对应版本。它数据可靠、覆盖全面,经三阶段构建。实验显示,现有视觉语言模型在视觉推理上短板明显,为模型发展指明方向。

新智元
产品应用7

Claude Code 更长更快!Agent能自己管项目了!从 Todo 升级到 Task

上周Claude Code团队更新任务清单系统,从「记事本」升级为「项目管理系统」。因模型能力增强,需求变复杂,原TodoWrite无法满足,新Task系统解决了任务依赖协调问题,支持复杂项目。

AI产品自由
开源动态8

首个基于 MCP 架构的低代码 RAG 框架

检索增强生成系统复杂度提升,科研人员面临高昂工程成本。清华大学等联合推出 UltraRAG 2.0,基于 MCP 架构,降低复杂 RAG 系统技术门槛与学习成本,支持低代码构建复杂系统

GitHubStore
推荐文章8

Claude团队大揭秘!如何调动多智能体搞深度搜索

Claude团队分享用多智能体构建深度搜索的心得,展示有效多智能体研究系统架构,涵盖系统架构、提示工程、评估方法等内容,还提及系统面临的问题、挑战及额外建议。

量子位