显存压缩」共找到 286 篇相关文章

新闻资讯7

又一家清华系具身智能企业浮出水面:天使轮融资数千万元,打造具身数据Infra丨甲子光年

清华系具身智能企业灵御智能完成数千万元天使轮融资,累计融资近亿元。其聚焦打造具身数据Infra,研发TeleAvatar和TeleDroid构建数据采集母机,锁定三类应用场景,还从两方面压缩成本。

甲子光年
开源动态8

刚刚,DeepSeek多模态技术范式公布,以视觉原语思考

DeepSeek发布多模态模型并公布技术报告,提出‘以视觉原语思考’。该模型解决多模态大模型‘指代鸿沟’问题,有把坐标变思维单元、7056倍视觉压缩、精心设计冷启动数据等创新,实验在多任务上超主流模型。

机器之心
开源动态7

实测最新开源的DeepSeek-OCR后,我有些不一样的看法,有些话可能只有我敢说

实测最新开源的DeepSeek - OCR,它并非传统OCR,不适用于传统场景。其最大意义是解决大模型上下文长度问题,通过文字图片压缩解压提高处理速度。模型功能多样,是让AI看图思考的新思路。

开源AI项目落地
推荐文章7

花了几百万办完一场AI大会后,想跟你分享这6个感悟。

作者分享举办AI大会的6个感悟,指出AI强大时线下真实更重要。如AI可消灭信息差但压缩不了体验差,品味是活出来的,线下交流能带来偶然性等,鼓励人们去线下获得真实体验。

数字生命卡兹克
开源动态8

混元3D世界模型1.0 lite版本发布,消费级显卡就能跑

腾讯混元3D世界生成模型HunyuanWorld 1.0发布即开源,可在消费级显卡运行,还能兼容传统CG管线。它分层实现3D生成,通过量化等技术降低显存开销,与同类模型相比优势明显。

量子位
算法论文8

谷歌的DeepSeek时刻:LLM推理加速被干到了8倍

谷歌TurboQuant论文介绍量化算法,能为大语言模型和向量搜索引擎大规模压缩。可将大语言模型KV缓存内存减至少6倍、加速达8倍且精度零损失,还介绍其工作原理及实验结果。

PaperAgent
开源动态8

MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070即可实时运行

面壁智能联合多机构发布 MiniCPM-o 4.5 技术报告,公开 Omni-Flow 框架。该模型 9B 参数实现端到端全双工全模态,开放在线 Demo、API 等,最低 12GB 显存 GPU 可运行,在多维度评测表现出色。

AI科技评论
新闻资讯8

陶哲轩经费被断供,在线发帖自证数学有用

菲尔兹奖得主陶哲轩就职的UCLA科研经费被冻结,个人研究及应用数学研究所IPAM失去资金支持,还遭网友质疑其学术成果价值。他开新帖以“压缩感知”研究为例,力证数学研究回报,并将视野扩展到AI大模型。

量子位
算法论文8

炸裂提速30倍!Meta提出REFRAF,无需改动模型,让RAG告别冗余与等待

近年来,RAG任务在提升模型回答质量的同时带来性能代价,Meta等团队合作提出REFRAG框架。它将无关段落压缩,引入强化学习选关键段落,实现高达30.85倍的TTFT加速,且无需改模型结构,实用性强。

深度学习自然语言处理
新闻资讯7

OpenAI发布GPT-5.1 Codex Max,编程能力比Gemini 3更强、更持久

为换回注意力,OpenAI紧急发布GPT - 5.1 Codex Max。它在编程测试中表现优于Gemini 3 Pro,还实现24小时项目级开发。引入自动压缩与扩展推理改进,效率提升,现已多途径可用,API访问将开放。

AI工程化