视觉智能」共找到 3939 篇相关文章

算法论文8

最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代

人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。

机器之心
产品应用8

32倍加速,58秒搞定720p视频!字节发布离散自回归框架,统一视觉生成和长视频生成

字节发布InfinityStar框架,将5秒720p视频生成时间从30多分钟缩至58秒,还支持多样任务。它基于对视频本质思考设计时空金字塔模型,将时空分离,通过多项技术优化,性能表现出色,不过也存在一些技术局限。

AIGC开放社区
算法论文8

突破具身智能“专家困境”!北大新方法让宇树G1靠单一框架掌握跳舞和侧手翻

北京大学与BeingBeyond团队联合研发的BumbleBee系统,用创新的‘分治 - 精炼 - 融合’三级架构,实现人形机器人在多样化动作中的稳定控制,破解传统控制策略的‘专家困境’与‘现实鸿沟’。

量子位
算法论文8

ICCV 2025 | 打造通用工具智能体的基石:北大提出ToolVQA数据集,引领多模态多步推理VQA新范式

北大团队提出ToolVQA数据集,用于提升基础模型工具使用能力。它含2.3万条样本,贴近真实需求。通过ToolEngine构建,涵盖多工具与任务领域。微调后模型表现佳,代码与模型已开源。

机器之心
算法论文8

AI一眼认出95万物种,还能分辨雄雌老幼,2亿生物图像炼成“生命视觉”大模型

俄亥俄州立大学团队用2亿生物图像训练BioCLIP 2模型,取得最优物种识别性能。它在无相应监督信号的非物种任务中,准确率远超DINOv2,还涌现出物种间生态对齐、物种内差异分离等生物学理解。

量子位
算法论文8

ICML 2025 | 给AI装上「智能升级插件」!阿里安全-清华大学D-MoLE让模型在持续学习中动态进化

近日,阿里巴巴集团安全部 - 交互内容安全团队与清华大学联合研究成果被 ICML 2025 收录。他们提出 D - MoLE 框架应对多模态大模型持续学习挑战,实验显示其性能优、训练快,还能用于提升阿里安全审核模型适应力。

机器之心
新闻资讯8

首个智能体商业信任协议来了!支付宝携手千问 App、淘宝闪购等发布 AI 商业协议 ACT

1 月 16 日,支付宝联合千问 App 等伙伴发布 ACT 协议,它是中国首个面向 Agent 商业需求的开放技术协议。该协议打造 AI 与服务平台‘通用语言’,解决授权、安全等问题,让操作更放心,还降低商家对接成本。

InfoQ
开源动态8

OPPO AI重磅发布:深度研究智能体,离“真正好用”还有多远?我们给大模型做了一次全身体检

2025年,Deep Research成AI热点,OPPO AI Agent Team对大模型评测。发布论文,开源评测基准FINDER和失败分类体系DEFT,揭示AI“装懂”“缺乏韧性”问题,还分析模型表现并给出发展建议。

深度学习自然语言处理
算法论文8

ICCV 2025 | 跨越视觉与语言边界,打开人机交互感知的新篇章:北大团队提出INP-CC模型重塑开放词汇HOI检测

北大团队提出 INP - CC 模型重塑开放词汇 HOI 检测。它提出交互感知提示生成和概念校准两项创新,结合输入图片特性构造提示集合,引入‘困难负样本采样’策略,在两大数据集上表现超 SOTA。

机器之心
新闻资讯8

“公司终局是纯 AI、纯机器人!”马斯克酒后激进预言:让机器人造机器人,未来要靠AI留着人类智能

近期马斯克参与近3小时对话,探讨太空数据中心、人形机器人等话题。他认为地面电力扩张难,太空是AI部署的经济选择,预计五年后太空AI量超地球。还指出未来公司形态是纯AI和机器人,中国制造业强且工作投入高。

InfoQ