「大型混合推理模型」共找到 2313 篇相关文章
逛完WAIC,我们发现这家芯企已经把端侧AI“场景落地”做实
7月17 - 20日,世界人工智能大会召开,端侧AI成热点。瑞芯微展台展示大模型、Agent、AI+应用,多方案已量产落地,其双轨架构优势突出,还规划了产品路线图。
具身智能空间视觉死穴,终于被最新顶会彻底解决!
招商局先进技术研究院下属实验室提出新的移动数据范式,以极低成本破解 VLA 的空间泛化瓶颈。研究团队识别出 VLA 模型三种捷径学习模式,提出层次化数据解耦策略,该方案在主流 VLA 模型上验证有效。
我去,真有这种,Openclaw 增强工具,ClawRouter 让 AI Agent 自己选模型、自己付钱,还能把 LLM 成本打下来 90%,爽~~
ClawRouter是开源本地LLM Router / Proxy,支持55+模型,能让AI Agent自动选模型、付费,将LLM成本降90%。它解决路由、支付等问题,适合做AI Agent、编程工具等产品的开发者。
让机器人学会「预判接触」:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题
它石智航联合四大顶尖机构发布论文 “TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation”,提出力条件触觉世界模型,让机器人能提前预判接触变化,在真机验证中性能优异。
告别直接生成,文生图进入Agent时代:港中文联合伯克利开源Gen-Searcher
过去文生图多是‘直接出图’,遇真实世界知识等易翻车。港中文等团队提出Gen - Searcher,让图像生成模型像Agent一样搜索等,数据、模型和代码均已开源,实验显示它提升了生图准确性和质量。
当黄仁勋反复提起OpenClaw,他到底在焦虑什么?|甲子光年
美国当地时间3月18日,「甲子光年」参加英伟达黄仁勋在GTC 2026的媒体会。黄仁勋多次提及OpenClaw,认为它很重要。英伟达不仅造GPU,还构建AI工厂,试图成为新计算秩序定义者。
ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案
多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。
CVPR 2026|清华联合美团推出3DThinker,首个用3D意象思考的工作
当前多模态大模型在空间理解任务表现弱,缺乏对几何信息提取能力。清华联合美团推出3DThinker,无需3D标注和外部工具,让模型内蕴‘想象’三维场景,在多基准上提升效果,且具备一定可解释性。
GAN之父Ian Goodfellow病后归来,剑指高效世界模型
GAN之父Ian Goodfellow等提出,利用符号化表示和游戏虚拟世界数据,或为构建动作条件多模态世界模型最佳路径,该模型可支持长时序任务预测与规划,还探讨构建原因、数据来源等。
年前看到最有深度的AI下半场Agents记忆机制综述
本文是一篇83页的基础智能体记忆机制综述,由27家机构联合发表。提出AI研究范式转变,记忆是填补理想与现实差距的关键。构建三维统一分类框架,介绍记忆操作、学习策略、评估体系、应用场景及未来方向。