「低比特量化」共找到 1172 篇相关文章
社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。
小模型,大能量!200美金的GPT Pro竟然输给了它?
博主用11个场景深度测试昆仑万维的Skywork R1V4 - Lite,它能做到Gemini 2.5 Pro才能干的事,速度快、成本低。在定位、人物识别、生活实用、专业鉴定、学术研究等场景表现出色,核心突破在于主动图像操作与深度推理。
FlashAttention 完全进化史:FA-4 发布之际的技术全景回顾
文章围绕FlashAttention展开,从Attention性能瓶颈引出问题,阐述其各版本演进。FA-1实现算法突破,避免O(N²)内存;FA-2适配架构,提升性能;FA-3深度协同,实现异步;FA-4探索更深异步和角色分工。还探讨跨芯片迁移及未来优化方向。
AI 编程工具在大型企业“遇冷”?网易 CodeWave 升级研发模式,不只关注“代码生成”
近些年,自然语言编程成 AI 编程产品主流。C 端通用 AI coding 工具表现出色,但国内企业级市场 AI 技术渗透率低。网易 CodeWave 专注企业级场景,指出通用工具痛点,提出‘可控的 AI coding’定位并升级能力,未来还将推新开发模式。
英伟达挑战者,估值490亿
AI芯片初创公司Groq完成7.5亿美元融资,估值达69亿美元。它由前谷歌工程师创立,致力于打破英伟达垄断,产品能低成本维持AI性能,但在生态、大规模模型支持等方面与英伟达有差距,短期内难威胁其地位。
Nature子刊 Scientific Data | 九家单位联合打造!AeroFlowData
现有湍流数据库多聚焦中低雷诺数基础湍流问题,难应对复杂工程高雷诺数湍流挑战。西北工业大学联合八家机构建全球共享的高雷诺数湍流数据库AeroFlowData,结合多技术获取数据,收录近40类模型、超500种工况,数据近100TB。
OpenAI重大发现:GPT-4b micro改造诺奖研究,山中因子重编程效率提高50倍
OpenAI与Retro Bio合作,用新模型GPT - 4b micro设计出新型山中因子变体,使重编程效率提高50倍。此前山中因子重编程效率极低,限制其应用,此次改进是突破。研究还在多方面验证了变体效果。
重磅!OpenAI时隔五年再发布开源模型gpt-oss:开源SOTA,可在16g笔记本运行
谷歌推出Genie 3后,OpenAI宣布发布开源推理模型gpt-oss,有gpt-oss-120b和gpt-oss-20b两个型号,采用混合专家架构和4位量化方案,能快速推理,原生支持128k上下文长度。文章还介绍了模型表现、训练等情况。
为什么 DeepSeek 大规模部署很便宜,本地很贵
文章探讨了DeepSeek-V3大规模服务便宜但本地运行贵的原因。指出推理服务存在吞吐量和延迟的权衡,受批处理大小影响。还分析了不同模型需大批次的原因,如专家混合模型、大型管道模型等。
480P的元宇宙入口:Midjourney不是在做视频,是在造"任意门"
Midjourney发布首个视频模型Video V1,它只能图生视频,操作便捷。虽分辨率仅480P,但采样率高。生成成本低,会员就能用。其美学表现好、生成速度快,不过在提示词理解等方面较弱。该公司有独特愿景。