「多模态智能硬件」共找到 4422 篇相关文章
UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!
多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI开源SWE-Vision框架,让模型用Python代码处理视觉判断。它极简设计,在五个视觉基准测试达最优,提升前沿模型视觉表现。
多模态大语言模型的核心技术架构与训练方法的进化
文章深入剖析多模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。
解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南
给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。
世界模型再迎新突破,兔展智能UniWorld-View登顶WorldScore榜单
近年来,世界模型成视觉 AI 重要研究方向。兔展智能联合研发的 UniWorld - View 登顶 WorldScore 榜单,完成昇腾算力适配与开源。它聚焦让 AI 理解未拍摄世界,解决了诸多技术难题。
GPT4核心成员、清华校友赵晟佳任Meta超级智能实验室首席科学家
Meta约一个月前宣布建立「Meta超级智能实验室」,为重振Llama雄风招揽人才。扎克伯格任命GPT4核心成员、清华校友赵晟佳为该实验室首席科学家,其履历亮眼,新研究范式或指明Meta科研方向。
ICLR 2026 Workshop二轮征稿开启:聚焦终身智能体的学习、对齐、演化
人工智能进入转折点,AI Agent 崛起但存在瓶颈。ICLR 2026 会议期间的 Lifelong Agent Workshop 将深入探讨相关问题,推动终身智能体研究范式,现开启二轮征稿。
速度提升,能力却暴跌?扩散模型做智能体的残酷真相
南洋理工大学陶大程教授团队联合发布评测报告,揭示扩散语言模型在智能体能力上有系统性缺陷,落后自回归模型。还分析其失败原因,提出评测框架,明确能力边界并给出研究建议。
华为推出软工代码智能体SWE-Lego,解锁SFT训练极致性能
华为研究团队推出仅基于监督微调(SFT)的软件工程代码智能体SWE-Lego,无需复杂RL流程,在SWE-bench Verified基准中表现出色,项目已开源。它有数据、训练和测试时扩展三大创新。
大模型智能体如何突破规模化应用瓶颈,核心在于Agentic ROI
上海交通大学联合中科大研究指出,大模型智能体规模化应用有瓶颈,核心在于Agentic ROI 未达实用门槛。研究提出其发展呈「之字形」,先规模提升信息质量,再轻量化降成本。
Langchain 、 Manus 组了一个研讨会:Agent越智能,死得越快!
Langchain工程师Lance Martin和Manus创始人Peak季逸超研讨Agent,指出Agent越智能死得越快,原因是疯狂调用工具致上下文过大。还介绍解决方案,如压缩与总结不同,Manus做减法架构更优。