主动视频推理」共找到 3090 篇相关文章

推荐文章7

2025-04-努力不是做好事情最重要的因素

作者分享个人生活、工作等多方面情况,提及播客发布,认为努力非工作做好的关键因素,深入探讨Agent在业务应用中的问题,还谈及视频更新、投资经历等,最后表示要审视目标、精简事务。

chaofa用代码打点酱油
开源动态8

机器人需要一个「思考系统」:τ0-VLA让具身智能迈向长程任务时代

2026 WAIC落幕,具身智能成焦点。当前VLA模型在长程任务中有局限,上海创智学院和智元机器人联合发布τ(0)-VLA,提出分层架构和新推理机制,用大量真机数据训练,在长程任务表现出色。

机器之心
推荐文章8

在WAIC耳朵听出茧子的「智能体」,是时候系统学一下了

今年世界人工智能大会上,智能体成主角,AI厂商纷纷布局。文章指出人们对AI大模型期望转变,介绍智能体底层逻辑,涵盖工具使用、推理模型、ReAct框架等,还对比先前尝试,探讨智能体能力层次与未来发展。

机器之心
新闻资讯8

空间智能爆发只需24个月?群核科技首席科学家唐睿预言:具身智能才是AGI终极形态 | 万有引力

群核科技首席科学家唐睿在访谈中表示,空间智能是具身智能基础设施,可解决其数据不足痛点。破数据瓶颈靠普及感知硬件,2D、视频与3D生成走向融合,空间智能爆点24个月内或随硬件突破到来。

AI科技大本营
算法论文8

万字硬核解读SAM 3:不止分割一切,它开始理解世界了

Meta的SAM 3能理解语义,实现可提示概念分割。它支持开放词汇、全实例分割等,架构有创新,数据引擎高效。评估显示其性能优异,与MLLM结合成SAM 3 Agent后推理分割能力强,但在专业领域和复杂场景有局限。

AIGC开放社区
新闻资讯7

顶模 Fable 5.1发布,到底强了多少?

昨晚,Anthropic发布Fable 5.1和Mythos 5.1,这代沿用Fable 5参数,性能提升聚焦长任务,还降低缓存读取价。它在游戏、视频等多个领域表现出色,与同类模型对比进步明显,虽价格贵,但能力、速度有提升。

鲸选AI
产品应用7

Qwen3-Next全新架构,32K场景MTP吞吐提升10倍

随着模型大小和上下文长度增加,为应对成本和部署挑战,Qwen3 - Next有突破性架构创新,解决上下文长度和总参数缩放问题。它采用混合注意力、超稀疏MoE等,MTP机制让其长上下文推理吞吐量比前身高10倍以上。

CourseAI
开源动态8

腾讯混元开源 4 个小尺寸模型,主打 Agent 和长文

8月4日,腾讯混元开源四款小尺寸模型,参数为0.5B、1.8B、4B、7B,消费级显卡可运行,适用于低功耗场景。模型具备推理快、性价比高特点,亮点是Agent和长文能力,已在腾讯多业务应用。

InfoQ
推荐文章7

图解Vllm V1系列5:调度器策略(Scheduler)

本文是图解Vllm V1系列5,聚焦调度器策略。先回顾vllm v1整体运作流程,接着阐述调度 - 推理的整体流程,包括将请求添加进Scheduler、Scheduler单步调度策略等,还对比了不同场景下的函数及调度逻辑。

GiantPandaLLM
开源动态8

万亿思考模型新速度!蚂蚁开源Ring-2.5-1T:IMO金牌水平,强;混合线性架构,快!

蚂蚁集团发布全球首个开源混合线性架构万亿参数模型Ring - 2.5 - 1T,打破深度思考牺牲推理速度和显存的‘不可能三角’。还同期发布扩散语言模型LLaDA2.1和全模态大模型Ming - flash - omni - 2.0,想做成可复用底座。

量子位