视频推理数据集」共找到 4934 篇相关文章

推荐文章7

前 DeepMind 研究员反思:评测,而非算力或数据,才是下一阶段的瓶颈

前 Google DeepMind 高级研究员 Lun Wang 在技术长文中指出,当前主流评测体系滞后,静态基准会“安静失效”。作者主张引入序参量,呼吁构建自演进评测,还为一线工程师提供了研发建议。

深度学习自然语言处理
产品应用8

字节跳动:Apache Doris + AI 一站式融合数据引擎的探索与实践

本文整理自字节跳动 DataMind 负责人演讲,介绍了基于 Apache Doris 打造的一站式引擎 DataMind。它集成 Hybrid Search、AI Function、GraphRAG 等能力,部分成果已贡献开源,还给出企业级 AI 问数落地方案。

InfoQ
算法论文8

四足机器人首次同时「思考+走路」,北大提出链式推理MobileVLA-R1

在「大模型+机器人」浪潮中,让机器人既听懂话又走得对、稳很难。北大MobileVLA - R1将链式思考引入四足机器人,在仿真和真实实验中对标强基线实现提升,构建了更具工程可用性的范式。

新智元
推荐文章7

爆肝一周看6小时长视频,解读AI时代程序员价值几何

作者花一周看完Lex Fridman对丹麦传奇程序员DHH的6小时访谈。DHH分享编程经历,谈对流行技术看法,认为AI不能取代人类创造力,还谈及创业、开源等观点,展现深刻认知与独特态度。

MacTalk
开源动态7

数学编码超越O3-high,英伟达版「DeepSeek R1二代」推理模型开源~

Nvidia开源OpenReasoning-Nemotron系列模型合集,采用Qwen2.5架构,基于500万条轨迹训练。评测输出长度最高64K token,多版本刷新SOTA。其‘heavy’模式有独特能力,32B版在数学与编程基准超越O3(High)。

PaperAgent
算法论文8

推理与操控能力双提升!具身机器人双系统VLA模型新突破

香港中文大学等联合提出Fast - in - Slow(FiS - VLA)统一双系统VLA模型,实现快慢系统融合。在真机和仿真测试中,成功率和控制频率提升显著,泛化能力强。未来计划探索动态调参机制。

量子位
算法论文8

打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力

如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力。

机器之心
算法论文8

突破通用领域推理的瓶颈!清华NLP实验室强化学习新研究RLPR

现有基于可验证奖励的强化学习(RLVR)应用范围局限,清华自然语言处理实验室提出 RLPR 技术,通过 Prob - to - Reward 提高概率奖励质量,有领域无关等特点,相关代码等已开源。

机器之心
算法论文7

让推荐学会思考:用强化学习激活大模型的序列推理能力

文章指出推荐系统曾未紧密结合大模型能力,如今正靠近其训练范式。作者基于用户行为序列,用强化学习训练大模型理解序列关系,以预测用户下一个可能点击的资讯,并通过实验验证了该方法的可行性,还探讨了不同数据库中BM25算法的差异。

AI科技评论
产品应用7

基于Agent的SGLang Diffusion Kernel优化实践:Qwen-Image、FLUX.2和视频模型

本文记录基于Agent完成Qwen-Image、FLUX.2、Wan和SANA Video优化的过程,包括定位问题、写Kernel及遇到的坑。介绍SGLang Diffusion Kernel结构,分析数值敏感原因,展示各模型优化实践、无收益实验及验证流程。

GiantPandaLLM