多模态智能体」共找到 4148 篇相关文章

新闻资讯7

GAIR Live 预告|从 IROS 2025,看智能机器人前沿趋势

IROS 2025 近日在杭州闭幕,作为全球机器人领域盛会,展示具身智能新突破与方向。GAIR Live 将携手学者与产业领军者,通过线上直播解读其核心趋势,拆解研究范式转向,还设有多个热门话题探讨。

AI科技评论
开源动态8

多模态LLM超越YOLOv3!强化学习突破多模态感知极限|开源

华中科技大学、北京邮电大学等多所高校研究团队共同推出纯多模态开源LLM——Perception-R1,该模型用强化学习优化视觉感知,目前论文和代码均已开源,其在视觉任务上表现出色,为后续研究提供强大baseline。

量子位
新闻资讯7

GAIR Live 预告|智能始于记忆,AgentMemory 的技术演化过程

在人工智能走向智能阶段,‘记忆’成焦点。如今大模型‘记不住’上下文,‘从Human Memory到Agent Memory’跃迁是迈向具身智慧关键。GAIR Live将邀专家探讨记忆技术逻辑与路径。

AI科技评论
算法论文8

多模态大模型持续学习系列研究,综述+Benchmark+方法+Codebase一网打尽!

近年来,生成式AI和多模态大模型进展显著,但在动态环境下实现持续学习是挑战。中科院自动化所联合香港院AI中心系统性研究,提出综述、方法、Benchmark和Codebase,为相关人员提供全面支持。

机器之心
产品应用7

屏下光谱颜色传感技术:开启环境智能感知的新纪元

智能机流行带来蓝光伤眼问题,手机屏幕技术变革,引入屏下光谱传感。艾迈斯欧司朗举办论坛分享成果,其开发的OLED屏下光谱颜色传感器,能精准重构XYZ响应,解决行业难题,获多方认可。

芯师爷
新闻资讯7

这家国内公司,在给具身智能技术栈做「通解」

具身智能是AI热门赛道,世界人工智能大会WAIC 2025让其概念渐明。国内梅卡曼德公司展位集合机器人技术多种落地形式,展示自研通用机器人「眼脑手」全栈技术产品,推动机器人各行业落地。

机器之心
开源动态8

视觉Token注入CLIP语义,走向多模态理解与生成新范式

腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端到端自回归训练,可接入LLM框架,降低计算与数据门槛,在多模态任务中表现优异,代码已开源。

量子位
新闻资讯7

李飞飞押注的空间智能:生成的世界,如何「经得起折腾」?

李飞飞押注的空间智能是世界模型主流路线之一,旨在让AI生成可操作三维世界。但当前AI生成世界存在“中看不中用”问题,构建“站得住”的世界面临速度与状态瓶颈,生境科技等实践提供了解决思路。

AI科技评论
产品应用8

AI 集成的智能 Profiling 实践:从性能分析到优化闭环

本文由韩钦亭撰写,分享了在已有 Profiling 平台引入 AI 智能辅助模块的实践。介绍了设计思路、工程实现、应用成效,对比不同大语言模型,通过实际案例展示优化效果,还探讨了 AI 在性能优化场景的未来潜力。

InfoQ
算法论文8

Monet:赋予多模态大模型如人类一般的抽象视觉思考能力

文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐式推理训练的难点,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。

机器之心