72B参数量」共找到 1245 篇相关文章

开源动态8

登顶!快手发布开源编程模型,720亿参数,创下编程能力新纪录

快手发布开源编程模型KAT-Dev-72B-Exp,在SWE-Bench Verified测试中登顶开源代码模型,与闭源GPT - 5成绩相近。该模型基于自研框架,有架构创新,还集成多种软件工程能力,是构建编程智能体的有力工具。

AIGC开放社区
新闻资讯7

个人开发者训400亿参数大模型:分布式算力,DeepSeek架构,3090单卡部署

Nous Research推出Psyche Network,可整合全球算力训练AI。它基于Deepseek的V3 MLA架构,有DisTrO优化器等技术,能让个人和小团体创建大规模模型,还实现40B参数LLM预训练。

量子位
开源动态8

小模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源

微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖大模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。

AIGC开放社区
开源动态8

只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型。

近期OCR赛道火热,作者应读者要求解读PaddleOCR-VL。它是百度PaddleOCR系列新模型,仅0.9B参数,在OmniDocBench v1.5评测多项领先。其架构高效,实测处理各类文档能力强,已开源。

数字生命卡兹克
开源动态8

最强开源0.9B级OCR模型!本地Agent、知识库都有救了!

百度飞桨PaddleOCR团队开源多模态文档解析模型PaddleOCR-VL,参数量仅0.9B,对算力要求低。它在OmniDocBench V1.5榜单屠榜,经测试,能精准识别发票、图表等,适合本地环境与资源受限设备。

开源星探
开源动态8

Meta重返开源!30B本地Agent塞进24GB显存,LeCun火速力挺

Meta重返开源,推出开源模型Muse Glimmer,参数30B,经量化后一块24GB消费级显卡就能跑通,拥有完整Agent能力。Meta还预告Muse Spark 1.2开放权重版本将发布,扎克伯格称会恢复发布部分开放模型。

量子位
开源动态8

清华系团队出手!一张 4090 即可「爆改」,1.3B小钢炮震撼开源

5月11日,清华系团队面壁智能联合多方开源端侧多模态大模型MiniCPM-V 4.6。它参数仅1.3B,性能超阿里、谷歌等同级对手,效率翻倍,还实现两项架构创新,适配主流开源生态,降低开发门槛。

新智元
新闻资讯8

具身智能一步踏入Scaling Law!10B+基础模型,27万小时真实数据

AI机器人创业公司Generalist推出新型具身基础模型GEN-0,参数量10B+,专为多模态训练构建。该模型展现强大Scaling Law,能力可扩展,有和谐推理等特性,在多方面有突破,成果备受赞誉。

机器之心
开源动态8

字节Seed团队发布Seed1.5-VL,用仅20B活跃参数在60个主流测试中狂揽38项第一!

字节Seed团队发布Seed1.5-VL,仅200亿活跃参数就在60个主流测试中获38项第一。介绍其架构、预训练、后训练等情况,评估表现出色,虽处理复杂场景有局限,但仍在多模态任务取得显著进展。

深度学习自然语言处理
开源动态7

以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能

dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。

PaperAgent