「多模态大模型智能体」共找到 9561 篇相关文章
AI不靠“闭门造神”,海内外一线专家共探智能新纪元,GOSIM AI Paris 2025圆满收官!
5月7日,GOSIM AI Paris 2025在法国巴黎迎来第二日议程。全球专家围绕AI技术多方面探讨,涉及模型、基础设施等主题。还分享大模型趋势,宣布新型许可证,各分论坛展示多元成果,大会圆满收官,杭州场9月待启。
为Token付费是一件很愚蠢的事情,用户应该为智能付费丨RockAI刘凡平@MEET2026
RockAI创始人刘凡平在量子位MEET2026大会提出,AI下一阶段要让模型“活起来”,实现硬件觉醒。他认为为Token付费愚蠢,应关注端侧智能,突破Transformer和反向传播算法,群体智能是迈向通用人工智能新路径。
150%训练效率提升:感知检测小模型训练优化方法
文章基于业务实践,总结感知检测小模型在不同算力卡上的训练方法,为智能驾驶场景提供借鉴。介绍测试环境、技术架构,分析环境依赖冲突、源代码适配等问题并给出解决方法,还提及性能优化及测试结果。此外还介绍用 RAGFlow 构建私有知识问答应用。
这张信息图,居然是8B开源模型做的??
商汤新开源的 8B 多模态模型 SenseNova U1,架构独特,图像评测表现好,信息图生成能力强、延迟低。它具备图文交错能力,适合自媒体、敏感行业等,有在线体验和开源代码入口。
不用千亿参数也能合成高质量数据!这个开源框架让小模型“组团逆袭”,7B性能直追72B
上海人工智能实验室与中国人民大学提出GRA框架,以“多人协作”理念让小模型分工生成高质量训练数据。实验显示其生成数据质量高,项目已开源。它打破对大模型蒸馏依赖,展现“集体智能”潜力。
字节跳动开源超强USO模型,AI绘图六边形战士来了
在AI图像生成领域,风格和主题驱动的图像生成一直脱节。字节跳动智能创作实验室推出USO模型,构建海量数据集,设计两阶段训练法,引入风格奖励学习范式,化解此难题,且已全面开源。
解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南
给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。
训具身模型遇到的很多问题,在数据采集时就已经注定了丨鹿明联席CTO丁琰分享
具身智能创企鹿明机器人联席CTO丁琰,分享具身智能数据采集现状、困境及新兴采集方式UMI。他强调具身模型问题多源于数据采集,还介绍鹿明产品FastUMI Pro,及其数据采集、模型训练生态。
宇树科技开源UnifoLM-WMA-0机器人模型,离通用机器人又进一步
宇树科技开源UnifoLM-WMA-0模型,用神经物理网络让机器人理解力学规律。它支持两种模式,融合多模态信息,架构精妙。经测试性能强,已真机部署。开源降低门槛,有望推动行业发展。
蚂蚁出手VLA,就是开源超越Pi0.5的基座模型
当前具身智能落地面临泛化能力不足的挑战,蚂蚁灵波开源发布的基座模型 LingBot-VLA 带来突破。它基于大量真实世界数据预训练,在多项真机任务测试中超越 Pi0.5,且在架构、效率等方面有创新。