7B模型」共找到 8061 篇相关文章

推荐文章8

她如何把“系统2”带给了大模型 |对话微软亚洲研究院张丽

本文是量子位对微软亚洲研究院首席研究员张丽的访谈。张丽团队在2023年开始探索大模型深度推理能力,2025年1月发布rStar - Math,用蒙特卡洛搜索算法让7B模型实现o1级数学推理能力,引发广泛讨论。

量子位
推荐文章7

本地LLM万字救场指南来了!全网超全AI实测:4卡狂飙70B模型

文章围绕本地大语言模型(LLM)展开,针对实用性和经济性问题,用Dell Precision 7960塔式工作站对主流模型测试。涉及不同尺寸模型、推理框架等,给出不同配置下性能指标及使用建议,还模拟真实场景测试。

新智元
开源动态8

智能体编程“小钢炮”:Qwen3.6-35B-A3B开源!

Qwen3.6-35B-A3B开源,是稀疏MoE模型,总参350亿、激活参数30亿,轻量高效,在智能体编程等方面表现卓越,超越前代,可与稠密模型媲美,支持多模态,已在Qwen Studio上线并发布开源权重。

千问大模型
新闻资讯8

寻明生科获1亿美元B轮融资,加码基座模型开拓AI药物发现新边界 | 5Y News

近日,寻明生科宣布完成1亿美元B轮融资,累计近2亿美元。资金将投入生物基座模型研发与规模化训练,升级Lab - in - the - Loop体系。该公司构建闭环AI原生基础设施,其模型能力获验证,商业变现多元。

五源资本 5Y Capital
产品应用7

OpenAI新模型gpt-oss-120b怎么样?三大场景实测首发(对比GLM-4.5-Air)

OpenAI发布新开源模型gpt-oss-120b,时隔6年再推开源权重语言模型,给LLM开源生态增添变数。作者实测它在三大场景的表现,并与GLM-4.5-Air对比,认为其距开源SOTA有距离。

花叔
算法论文8

14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1

如今的大语言模型推理能力关键在于测试时扩展,但长思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。

机器之心
算法论文7

Qwen3 变身扩散语言模型?不从零训练也能跑,30B参数创纪录

扩散语言模型(DLM)潜力大但训练难,Radical Numerics团队改造Qwen3-30BA3B,推出30B参数的开源扩散语言模型RND1-Base。该研究系统性研究A2D转换关键因素,成果超现有部分模型,还提出简单方法及训练策略。

机器之心
开源动态8

小钢炮开源,一张3090两小时「从零训练0.1B全模态模型」,模型训练彻底平民化

MiniMind - O是开源超轻量级端到端全模态大模型,采用双轨架构。仅需一张RTX 3090,2小时就能从零训练全链路。有两套训练数据,具备零样本声音克隆等特点,实现大模型训练平民化。

开源AI项目落地
开源动态8

攻克大模型训推差异难题,蚂蚁开源新一代推理模型Ring-flash-2.0

9月19日,蚂蚁百灵大模型团队开源新一代推理模型Ring-flash-2.0,独创棒冰算法解决训推差异难题,实现稳定训练。该模型仅激活6.1B参数就能打平40B Dense模型性能,降低推理成本。

机器之心
开源动态8

114B参数、6B激活,Sand.ai刚刚把全球首个千亿MoE视频生成模型开源了

Sand.ai团队开源全球首个千亿MoE视频生成模型MAGI - 2 - preview,总参数114B,单次前向激活约6B,成本低效果好。该模型解决了视频生成Scaling难题,架构、系统设计出色,开源将改变行业规则。

量子位