多模态大模型」共找到 9471 篇相关文章

推荐文章8

2025 年 InfoQ 趋势报告:AI、ML 和数据工程

InfoQ AI ML 趋势报告基于编辑团队与嘉宾播客,总结 AI、ML 技术发展趋势。涵盖 AI 代理、多模态语言模型等创新领域,也提及早期采用者、早期多数、晚期多数类别的技术,还对 2025 年相关领域发展作出预测。

InfoQ
开源动态8

追平GPT-4o,数学基测96.3%高分,Hermes4 来了

Nous Research推出新一代模型Hermes 4系列,其有混合推理和长度控制机制,还能用DataForge“造”数据,经Atropos质检。它在数学等领域表现佳,追平GPT - 4o,是开源AI对巨头的挑战。

AIGC开放社区
推荐文章8

长上下文不再难:KV Cache 全生命周期优化实战

长上下文语言模型发展带来计算和内存挑战,现有基准测试多忽视 KV 缓存完整生命周期。微软姜慧强在 AICon2025 分享 SCBench 工具,梳理推理优化方法,介绍 MInference 等,还提出 Tri - shape 方法等成果。

AI前线
新闻资讯7

市场还没爆发,但AI眼镜已经卷死了

今年5月多款AI眼镜新品上线,市场竞争激烈。硬件上芯片向高端手机靠拢,软件借AI模型落地功能,还出现代工产业链。不过,国内AI眼镜在AI和软件功能上有不足,与市场需再磨合。

芯师爷
算法论文7

一文解读 LLM Posting-Train技术

文章解读了语言模型后训练(Post-training)技术,介绍其核心价值,从微调、强化学习、测试时拓展三方面展开,分析现有技术瓶颈,指出前沿研究方向,还给出实践指南和工具链推荐。

海边的拾遗者
开源动态8

从VLA到RoboOmni,全模态具身新范式让机器人察言观色、听懂话外音

复旦学等联合推出全模态端到端操作模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现全面领先。

机器之心
算法论文8

更多thinking≠更好结果,精准thinking可砍掉一半长度

当前模型如GPT - 4、DeepSeek推理又长又啰嗦,论文发现其在简单题目上过度推理。作者提出‘无效思考’概念,还给出解决原则,用LC - R1方法训练,效果显著,揭示精准思考才是王道。

深度学习自然语言处理
推荐文章8

Claude:Profile and Preference

文章借与Claude对话,探讨Profile和Preference概念,分析其区别联系,指出AI时代借助模型理解用户的变化,还谈及数据源、实时个性化、偶然性、广告变革等问题,最后Claude为作者生成简易画像。

李继刚
新闻资讯7

凭借 27 万小时真机数据,Generalist 可能是最接近“GPT-1 时刻”的顶级机器人团队

Generalist是机器人领域有潜力的公司,凭借27万小时真机数据或达GPT - 1量级,领先6 - 12个月。团队成员来自顶尖机构,技术强,demo展示出模型灵巧性。不过也面临Scaling Law不确定、数据缺口、商业化场景缺失等风险。

海外独角兽
开源动态8

音频全能王炸!小米MiMo-Audio开源,力压Gemini/GPT-4o!

小米团队开源通用音频模型MiMo-Audio,集多种功能于一身,支持7国语言零样本克隆和中英混合合成。首包延迟低,效果自然稳定。在多个基准测试中表现优于Gemini-2.5-Flash和GPT-4o-Audio。

开源星探