「72B参数量」共找到 1245 篇相关文章
MoE推理「王炸」组合:昇腾×盘古让推理性能狂飙6-8倍
在通往AGI进程中,MoE模型成大模型推理提效关键。华为推出Pangu Pro MoE 72B模型,经多方面优化,推理性能提升6 - 8倍。还采用多种策略和算法,在昇腾不同平台展现卓越性能,为大模型落地提供支撑。
GLM-5架构曝光,智谱两日涨60%:采用DeepSeek同款稀疏注意力
GitHub代码确认GLM - 5架构细节,它采用DeepSeek - V3/V3.2架构,含稀疏注意力和多Token预测,参数量745B。OpenRouter上神秘「Pony Alpha」被指是其测试版,受消息影响智谱AI港股两日涨60%。
首发Omni-Flow流式全模态架构,消费级显卡就能跑
面壁智能等联合发布MiniCPM-o 4.5技术报告,公开Omni-Flow流式全模态框架。该模型凭9B参数实现端到端全双工全模态,可在消费级显卡运行,还推出在线体验Demo等,性能表现佳,应用潜力大。
这可能是,全球最强开源Agent模型,走了一条反Scaling Law的全新范式!
MiroThinker v1.5开源,其30B小模型在Agent benchmark上击败万亿参数的Kimi K2T。它以交互深度为新Scaling维度,训练有严格时间管控,实测表现超Search Agent,“小模型+强交互”或成新方向。
AI Code要变天了,Meta首个代码世界模型登场!
Meta FAIR推出32B参数的代码世界模型(CWM),旨在探索世界模型如何改变代码生成和推理,code和mode已开源。在SWE - bench验证中表现优,能与更大规模或闭权重的LLM竞争,还介绍了训练、数据集等情况。
社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。
Claude时代终结?LMArena实测DeepSeek R1编程得分超Opus 4,但月暗称其新模型更胜一筹
在闭源模型主导的AI环境下,开源的DeepSeek - R1(0528)在LMArena测试中表现亮眼,编程得分超Claude Opus 4,引发社区关注与讨论。不过LMArena曾被指责偏袒,其联合创始人反驳。此外,月之暗面新模型Kimi - Dev - 72B编程成绩超R1。
禁令之下,黄仁勋再用“阉割芯片”抢夺中国市场
美国芯片出口管制冲击英伟达,其在中国市场损失大、份额降。黄仁勋计划7月推‘阉割芯片’B20、B40/B30抢市场。不同客户有选择倾向,同时国产GPU有机会也面临难题,企业还尝试海外训练模型。
百度开源视觉理解模型Qianfan-VL!全尺寸领域增强+全自研芯片计算
今天百度智能云千帆推出全新视觉理解模型Qianfan - VL并全面开源,含3B、8B和70B三个版本,基于自研昆仑芯P800计算。它特点多、性能优,应用场景广,未来还将推新产业级模型。
Qwen 3-235B Aider编程能力击败Claude3.7,成本便宜百倍
Qwen3-235B-A22B在Aider多语言编码基准初步测试中击败Sonnet 3.7 Thinking和OpenAI o1,成本便宜150到600倍。Qwen3-32B准确率超GPT-4.5和GPT-4o ,代码编辑格式正确率达100%。