「视觉大模型」共找到 9246 篇相关文章
Stream-Omni:同时支持各种模态组合交互的文本-视觉-语音多模态大模型
中国科学院计算技术研究所团队提出文本-视觉-语音多模态大模型Stream-Omni,能支持多种模态组合交互。它对各模态关系针对性建模,实现高效灵活的模态对齐,仅用少量语音数据就有多种交互能力。
直接从像素到单词:这个原生大模型统一单图、多图、视频和空间智能
南洋理工大学等团队推出NEO - ov模型,挑战传统「视觉编码器 + 大模型」范式,直接从原始像素学语言。它在多任务表现出色,尤其空间智能突出,但在OCR等方面有短板,展现原生多模态建模潜力。
文心大模型 4.5 系列正式开源,涵盖 10 余款模型
6月30日,百度正式开源文心大模型4.5系列,含10款模型,实现预训练权重和推理代码全开源。可在飞桨星河社区等平台下载,百度实现框架与模型“双层开源”,技术创新多,性能表现优。
多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开
上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。
华为中科大联创大模型低比特量化算法,1‰数据实现昇腾无损压缩7倍
华为诺亚方舟实验室联合中科大提出CBQ后训练量化方案,仅用0.1%训练数据实现大模型7倍压缩,保留99%精度。该成果登ICLR 2025 Spotlight,已加入昇腾ModelSlim工具包。
英伟达帮你省钱,让大模型推理「短而精」,速度快5倍
过去大模型推理追求长链思维,导致推理链长、Token消耗大、响应慢。英伟达研究院的DLER研究给出解决办法,通过强化学习优化方法让模型‘短而精’,推理长度减超70%且准确率不变,还适用于大模型。
国产类脑大模型适配国产沐曦GPU!长序列推理提速超百倍,仅用2%数据匹敌主流模型
中国科学院自动化所李国齐、徐波团队发布类脑脉冲大模型SpikingBrain (瞬悉)-1.0,借鉴大脑信息处理机制,适配国产沐曦GPU,长序列推理提速超百倍,仅用2%数据匹敌主流模型,探索构建国产自主可控类脑大模型生态。
世界首个!李飞飞团队推出物理推理基准,大模型统统不及格?
斯坦福联合中科大团队推出世界首个评估视觉语言模型物理推理能力的基准QuantiPhy,通过测试发现顶尖模型在数值计算上不如人类,还揭示模型推理靠记忆而非测量,为AI发展指明方向。
从大数据到好猜想:如何用大模型做市场研究?
文章指出大模型重塑用户需求调研,并非按常规用AI获取和清洗数据,而是让模型扮演真实用户。以品牌分析社交媒体数据为例,探讨大数据局限,还介绍‘好猜想’标准,最后说明Atypica.AI能构建消费者智能体解决归纳问题。
别再迷信大模型!吴恩达亲授AI秘籍:小模型+边缘计算=财富密码
吴恩达指出,AI创业真机遇不在大模型,而在智能体。智能体市场潜力大,创业者可发挥其专业化优势。还建议忽略AGI,用AI解决日常问题,关注小模型边缘计算、军民两用场景,构建可信AI应用。