「视觉记忆模型」共找到 8119 篇相关文章
国内外AI大厂重押,初创梭哈,谁能凭「记忆」成为下一个「DeepSeek」?
文章指出‘记忆’或成引爆新一轮AI浪潮的关键。当前,国内外AI大厂和初创企业纷纷入局,围绕‘记忆’研究是大模型新方向。‘记忆’是技术和应用的双重诉求,研究路线多样且各有优劣,未来竞争激烈,谁能突围尚未可知。
MIRIX重塑AI多模态长期记忆:超Gemini 410%,节省99.9%内存,APP同步上线
UCSD和NYU团队推出开源的MIRIX,全球首个多模态、多智能体AI记忆系统。它表现亮眼,在多任务中超越传统方法,有类人记忆系统等特点,还上线Mac端应用,开启大模型从对话生成到长期记忆驱动心智的新周期。
从网页截图到精准复刻只需30秒:这个新模型刷新了我的认知
智谱AI发布GLM - 4.6V系列模型,是首个支持工具调用的视觉模型。作者对其进行7个场景测试,如识别鸟类、分析赶海地点等,展现出不错性能。该模型速度快、开源,有优势也有小问题,适合开发者和普通用户。
0.005%参数量超越SOTA!提升模型能力无需庞大奖励模型
上海交通大学等校联合团队提出轻量级奖励模型SWIFT,利用大模型隐藏状态线性特征,仅训练极小线性层,在推理任务中超越主流奖励模型,实现计算效率与准确率双提升,且在多领域表现出色。
阿里通义的视觉RAG革命!VRAG-RL:基于强化学习的视觉感知RAG框架,性能飙升30%
阿里巴巴通义实验室推出VRAG - RL,融合视觉感知、多模态推理与强化学习,已在GitHub开源。它破解传统RAG处理视觉数据难题,通过创新机制提升性能,在多数据集表现出色,还将向更拟人化和低幻觉方向发展。
CVPR 25 |全面提升视觉感知鲁棒性,生成模型快速赋能三维检测
香港中文大学(深圳)等单位学者提出 DriveGEN 无训练自动驾驶图像可控生成方法,无需额外训练生成模型,通过两阶段策略扩展训练数据,提升三维检测模型鲁棒性,代码已开源。
解决VLA模型落地难,普通硬件也能跑!全透明全开源的高效VLA模型把推理成本砍掉76%
2026年4月,中山大学与MBZUAI联合推出A₁模型,它是完全开源透明、自适应高效的截断式视觉 - 语言 - 动作模型,能削减推理成本、实现低成本落地,在仿真与真机上表现优异。
阿里 Qwen 又双叒发模型,继基础、编程模型后,最强推理模型 Qwen3 Thinking 登场,击败Gemini 、R1?
阿里通义千问发布最强推理模型 Qwen3-235B-A22B-Thinking-2507,逻辑、通用技能等能力更强,原生支持 256K 上下文。此前已发布基础和编程模型,Qwen API 在 OpenRouter 表现佳,受社区关注。
行为记忆+认知记忆,中科大MemWeaver重构LLM个性化记忆
论文MemWeaver被The Web Conference 2026接收,它聚焦用户从隐式到显式文本交互时个性化生成的升级问题。提出将用户历史升级为层次化记忆,构建行为与认知双记忆模块,主实验表现优,消融实验验证其结构设计关键。
端到端语音模型:从语音表征到模型架构
本文整理自阶跃星辰语音模型负责人杨学锐在2025年QCon全球软件开发大会的分享。介绍大模型对语音技术的重塑,涵盖识别、合成等方面;阐述端到端语音模型构建,涉及表征、架构、训推和任务;还提及模型评估方法。