具身多模态推理」共找到 2917 篇相关文章

新闻资讯7

数据困局下的身智能,谁能率先破局?

身智能面临数据困局,Skild AI 关注真实数据不足难题。学者 Levine 称只有真实数据能达通用身智能,而王鹤认为合成数据可助身智能冷启动和规模化发展。遥操作和 Sim2Real 是不同技术路线。

机器之心
新闻资讯7

身智能的终极命题:是造「人」还是造「生产力」?

华为开发者大会 2025 发布 CloudRobo 身智能平台,为身智能带来新视角。工业和商业场景实践显示,身智能终极目标是锻造普适的「生产力引擎」,产业竞赛关键在于打造「群体智能协同」。

机器之心
产品应用8

火山引擎 veFuser:面向扩散模型的图像与视频生成推理服务框架

近年来扩散模型在图像和视频生成领域取得突破,但 DiT 模型推理面临计算量大、模型多样、实时性需求等挑战。火山引擎推出 veFuser 推理框架,能在图片和视频生成上实现低延迟、低成本的高质量体验,且未来会持续迭代。

InfoQ
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。

PaperAgent
推荐文章8

万字长文!大模型(LLM)推理优化技术总结(非常详细)

文章聚焦大模型推理优化技术,介绍推理过程分预填充与解码阶段,还阐述模型并行、注意力机制优化、模型优化及服务技术等,如多查询注意力减少内存,FlashAttention 优化计算顺序。

AINLPer
新闻资讯8

触觉身来了个梦之队:天使轮近亿

5月27日,上海新智身智能科技有限公司宣布完成近亿元天使轮融资。该公司源自复旦大学,核心团队实力强。它聚焦触觉身智能,构建技术闭环,在数据采集、模型训练等方面有进展,已在工厂落地POC验证订单。

量子位
开源动态8

谷歌让机器人「长脑子」了!首发离线身VLA模型,断网精准操控

谷歌首发身智离线模型Gemini Robotics On-Device,实现VLA多模态大模型在身机器人本地离线运行,无网络也能稳定运行。谷歌还开源了SDK,身智能迈向实用化新阶段。

新智元
算法论文8

大模型训练新突破!“不对称”训练让AI学会自我反思,推理零开销

字节团队提出全新语言模型训练方法PCL,首次打破训练与推理对称约束,实现‘训练-推理不对称’。在训练时让模型反思评估结果,推理时仅输出答案,零额外开销,显著提升模型能力。

量子位
新闻资讯8

身智能「全明星日」来袭!智源组局30+行业掌门人,激辩机器人终极命题

2025年是身智能「爆发之年」。智源身2025 OpenDay上,30多位行业大佬激辩,议题包括身架构、数据获取、硬件瓶颈、应用落地等,智源还开源多项成果助力行业发展。

新智元
算法论文8

推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限

大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。

新智元