视觉transformer」共找到 870 篇相关文章

算法论文8

全球首个人形机器人通用视觉感知系统,Humanoid Occupancy建立多模态环境理解新范式

北京人形机器人创新中心推出 Humanoid Occupancy 感知系统,创新性融合多模态传感器信息,构建通用感知框架。它以语义占用表征为核心,有全编码和适配融合优势,经实验验证性能优,推动机器人迈向通用感知时代。

机器之心
算法论文8

DiffMoE:动态Token选择助力扩散模型性能飞跃,快手&清华团队打造视觉生成新标杆!

清华大学和快手可灵团队推出DiffMoE,通过创新的动态token选择机制和全局token池设计,拓展了扩散模型的效率与性能边界。实验表明,DiffMoE在多方面超越现有模型,未来集成先进技术或有新增益。

机器之心
产品应用8

Hybrid Model Support:阿里云 Tair 联合 SGLang对 Mamba-Transformer 等混合架构模型的支持方案

文章介绍阿里云 Tair KVCache 团队与SGLang社区在推理框架上支持混合架构模型的工程化实践。分析混合架构崛起原因、面临挑战,阐述内存管理、关键技术优化方案,验证性能,并指出未来演进方向。

阿里云开发者
推荐文章8

Transformer到Agent:生成式AI行业技术路线与职业发展指南,深度解析AI价值链

文章深度解析生成式AI行业,介绍其宏观图景、商业运作、行业定位与战略考量。指出行业价值链呈“杠铃”形态,应用层机会大,还提及盈利模式、岗位薪酬、开源闭源之争等,为从业者提供职业指南。

AI Reading Hub
新闻资讯8

OpenAI资深研究科学家、Transformer联合作者Łukasz Kaiser领衔,2026 奇点智能大会·北京站正式官宣

2026年,Sam Altman等四位AI界大佬称已进入奇点。11月20 - 21日,奇点智能大会北京站将举行,两大核心会议同期举办。OpenAI资深科学家Łukasz Kaiser将演讲,会议汇聚专家探讨AI前沿与底层技术。

AI科技大本营
算法论文8

ICLR 2026 | 7B小模型干翻GPT-5?AdaResoner实现Agentic Vision的主动「视觉工具思考」

文章介绍了AdaResoner模型,它学会‘何时用工具’,在拼图推理上击败GPT - 5。Google为Gemini 3 Flash引入‘Agentic Vision’,与AdaResoner殊途同归。AdaResoner有独特训练方法,提升小模型性能。

机器之心
开源动态8

华为开源7B多模态模型,视觉定位和OCR能力出色,你的昇腾端侧“新甜点”来了

华为推出开源多模态模型openPangu-VL-7B,适配昇腾端侧。它推理性能性价比高,在多核心任务表现突出,技术报告还披露核心技术细节,为昇腾使用者带来新选择,丰富昇腾生态。

量子位
算法论文7

中国科学SCPMA | 南科大王建春团队:基于改进隐式轴向分解Transformer的三维槽道湍流快速预测

南科大王建春团队改进IFactFormer模型,采用“并行”轴向分解注意力机制,提升在复杂流动问题中的表征能力和稳定性。实验显示,改进模型拟合与长期预测能力强,多数指标精度优于传统方法。

力学与人工智能
算法论文8

ICML2025|宁波东方理工大学刘野,陈云天:DragSolver:用于真实汽车风阻系数估计的多尺度Transformer方法

当汽车高速行驶,空气阻力影响车辆性能。传统风阻系数测算方法耗时久,难以满足实际需求。宁波东方理工大学等机构研究者提出DragSolver模型,能快速准确估计风阻系数,经实验验证效果优,有降本增效等价值。

力学与人工智能
开源动态8

全景视觉的Depth Anything来了!Insta360推出DAP,200万数据打造全场景360°空间智能新高度

Insta360等团队推出全景度量深度基础模型DAP,构建200万量级全景数据引擎,设计三阶段伪标签管线,在模型架构上也有创新,在多项测试中效果优异,项目代码与模型已开源。

机器之心