长视频理解」共找到 2145 篇相关文章

算法论文8

首次!世界模型、动作模型融合,全自回归模型WorldVLA来了

阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。

机器之心
推荐文章8

深入原子世界,他在寻找材料失效的原因

文章介绍了美国宾夕法尼亚州立大学副教授杨洋的材料研究。他利用先进电子显微技术,研究材料在极端环境下微观过程,如空位、虫洞腐蚀和短程有序,旨在理解材料失效机制,推动材料设计优化。

DeepTech深科技
新闻资讯7

GPT-5的所有传言,以及,Sora 2?

OpenAI今晚1点举办直播,GPT - 5将亮相。发布前关键信息汇总,包括直播时、GitHub泄露四个版本、三档定价策略、突破人类基准测试等,还或同步发布Sora 2。

AGI Hunt
新闻资讯7

登上热搜!Prompt不再是AI重点,新热点是Context Engineering

最近「上下文工程」很火,Andrej Karpathy 为其打 Call。它和「提示词工程」不同,是构建自动化系统给模型提供输入。文章介绍了其核心要素、实践方法论,还给出了参考的博客和视频

机器之心
产品应用8

从0到1带你速通 Marvis马维斯

AI 时代,Agent 产品虽强但普通用户使用门槛高。本文详细介绍腾讯 Marvis,它能让 AI 直接理解电脑,可执行多项任务。作者实测 6 个任务展示其功能,认为它是面向普通用户的系统级 AI 管家。

腾讯技术工程
产品应用8

X-Era蝉联双榜单冠军,引领世界模型未来方向

X-Era的EonWorld在WorldScore和WorldArena两个榜单上连续霸榜。它来自X-Era的VWA原生世界动作模型体系,本职是帮机器人预判世界变化。这为“可用于行动的世界模型”竖起能力线,也揭示行业正进入新阶段。

AI科技评论
新闻资讯8

GPT-5.2连肝7天,300万行代码造出Chrome级浏览器

Cursor的CEO让GPT - 5.2连续运行一周,产出300万行代码,从零构建Chrome级浏览器。还介绍不同模型任务表现、多智能体协作架构,指出这将颠覆软件开发经济学。

新智元
算法论文8

ICLR神秘论文曝光!SAM3用「概念」看世界,重构视觉AI新范式

2023年Meta推出SAM,后SAM 2扩展到视频分割。近日,SAM 3现身ICLR 2026盲审论文,带来「基于概念的分割」新范式,强调按「语义概念」理解和分割图像,还构建数据引擎提升性能。

新智元
算法论文8

AI一眼认出95万物种,还能分辨雄雌老幼,2亿生物图像炼成“生命视觉”大模型

俄亥俄州立大学团队用2亿生物图像训练BioCLIP 2模型,取得最优物种识别性能。它在无相应监督信号的非物种任务中,准确率远超DINOv2,还涌现出物种间生态对齐、物种内差异分离等生物学理解

量子位
算法论文8

盛大AI研究院新作:流式生成超越非流式,一句话让虚拟人动作丝滑如真,推理延迟仅1帧

盛大AI研究院与东京大学联合提出FloodDiffusion,首个基于定制化扩散强制的流式人体动作生成框架。它能零延迟生成无限动作序列,解决了现有方法的问题,在多数据集评估中表现优异。

量子位