「共享空间」共找到 631 篇相关文章
GAIR 2025 世界模型分论坛:从通用感知到视频、物理世界模型的百家争鸣
第八届GAIR全球人工智能与机器人大会世界模型分论坛上,五位青年学者围绕世界模型展开精彩演讲,话题涵盖通用感知、三维技术等。他们的研究为世界模型领域带来不同启发,目前该领域研究尚处起步阶段,共识未形成。
CUTLASS CuTe GEMM细节分析(三)——Swizzle<B, M, S>模板参数的取值
文章以(8, 32):(32, 1)为例,探索确定Swizzle<B, M, S>中M、S和B参数的方法。指出M、S与PTX指令及共享内存多Bank结构相关,B用于指定Swizzle行数避免bank conflict,还给出不同Layout的参数取值。
3D-R1重塑三维视觉语言推理!让三维交互更智能
近年来,视觉 - 语言模型在2D图像理解有突破,但3D视觉语言模型面对复杂场景不足。为此上海大学团队提出3D - R1模型,它基于新数据集和策略构建,有强多任务三维理解能力,不过也存在进步空间。
实测LibTV团队版:AI视频的工作室时代来了!
作者实测LibTV团队版,分享用其制作皮克斯风格3D动画片段的过程,介绍团队版核心功能,如团队主体库、共享积分池、权限管理等,还提及新功能,指出AI视频走向工业化,而该团队版是首个专注团队协作的工具。
准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用
近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。
CVPR 2025 | 如何稳定且高效地生成个性化的多人图像?ID-Patch带来新解法
本文围绕个性化多人图像生成展开,指出其面临身份特征泄露等挑战。介绍了早期方法的不足,提出全新的ID-Patch方案,阐述其设计思路、实验效果等,还探讨了提升空间与未来方向,该方案在多人物图像生成中有突破式提升。
攻克结构化长文档检索难题!新框架让模型告别“结构性失明”
SEAL团队推出全新对比学习框架SEAL,通过带结构感知和元素对齐,将文档宏观层级结构和微观元素语义融入Embedding空间,提升模型对结构化数据的理解。在BGE - M3模型上提升了MRR@10指标,还开源了万级字数长文档数据集。
谷歌Nano Banana Pro炸了!硅谷AI半壁江山同框,网友:PS已死
谷歌推出基于Gemini 3 Pro的图像生成模型Nano Banana Pro,在图像编辑和生成上实现史诗级进化,有更广知识储备、超强文字渲染和精准细节把控。它支持4K原生,知识推理强还能直连搜索,玩法多样但也有改进空间。
【CUDA 博客】TMA简介 & 让矩阵转置在Hopper GPUs上变得更快
文章介绍Hopper GPU新特性TMA,它能高效传输多维数组数据。文中展示用TMA对2D数组操作,如创建张量映射、编写kernel等。还讲了避免共享内存bank冲突的交织方法,最后介绍在Hopper GPU上实现高效矩阵转置的多种方式及性能。
具身智能落地物流行业的最大难题,被京东物流撕开一道裂缝
在科技领域,物流行业常被视为最不“性感”的赛道之一。随着具身智能火爆,智慧物流又迎来新的想象空间。9月25日,在JDD 2025京东全球科技探索者大会上,京东物流正式发布“超脑2.0”与“异狼”系列新品,旨在填补物流智能化“认知”与“执行”高度统一的关键空白。