「权重外推」共找到 822 篇相关文章
模型、代码、数据全开源!轻松训练自己的垂类Agent!
Together AI联合Agentica推出`DeepSWE-Preview`,基于开源Qwen模型,用RL在SWE - Bench - Verified登顶。团队将模型权重、训练框架等全开源,抛弃SFT纯用RL训练,还分享训练秘籍和TTS技巧,为垂类Agent训练提供新范本。
20人团队提前实现DeepSeek构想,AI算力变天?直击大模型算力成本痛点
国内20人玉盘AI团队推出SRDA全新计算架构方案,试图从硬件源头解决当前AI算力核心瓶颈。该架构有诸多创新设计,能应对大模型训推痛点,与DeepSeek构想契合,或成大模型专用架构分水岭。
时隔两月,Mistral AI终于上新Medium 3,近期还有「One more thing」
时隔两月,Mistral AI 推出 Mistral Medium 3,性能介于轻量级和大规模模型间,优于 GPT - 4o 等。未开源,可通过官网等使用,专为企业设计,成本低。还预告将推「大型」产品,同时推出企业聊天机器人 Le Chat Enterprise。
英伟达龙虾模型开源,12B激活登上成功率全球第四
英伟达发布专为龙虾打造的开源模型Nemotron 3 Super,总参数120B,激活参数12B,在龙虾模型基准PinchBench上成功率全球第四。该模型结合Mamba与Transformer架构,引入多项创新技术,还开源了模型权重、数据集等。
老黄入局吃龙虾!英伟达发布最强开源Agent推理模型
英伟达发布并开源120B参数的MoE模型Nemotron 3 Super,在多项测试中表现出色。它原生支持100万token上下文,吞吐量大幅提升。英伟达还计划五年投260亿美元构建开源AI模型,开放全参数权重等。
上交大和辉羲把LLM刻进ROM!推理性能冲2万token/s,GPU时代终结?
硅谷Taalas将大模型‘物理焊死’进芯片引关注,而上海交大、辉羲智能与微软亚洲研究院团队用ROM+SRAM异构架构,将端侧LLM推理速度推至20,000 tokens/s。介绍了ROMA和TOM架构优势及应用场景。
Agent 真正的护城河,正在从工具转向记忆资产
2026年初,Anthropic用Claude Cowork引发AI创业热点,其计划引入知识库获“永久记忆”能力,将Agent Memory探索推到前沿。文章探讨独立Memory层成必需品的原因、工程化记忆系统的能力,还对比模型厂商和第三方中立派路线。
AI PC进入爆发期,国产芯片能否在其中分得一杯羹?
AI从云端走向端侧,AI PC迎来爆发期。Arm虽有结构性优势,但在PC端进展慢。此芯科技推出此芯P1,联合多方打造开放平台,推动标准化和生态建设,产品也不限于AI PC,未来有望为国产芯片争得话语权。
首个代码世界模型引爆AI圈,能让智能体学会「真推理」,Meta开源
Meta重组后的AI部门推出首个代码世界模型CWM,是320亿参数开放权重LLM。它与传统大模型思路不同,能模拟代码执行。CWM在通用编程与数学任务表现不错,Meta还开放相关检查点以支持研究。
百度开源视觉理解模型Qianfan-VL!全尺寸领域增强+全自研芯片计算
今天百度智能云千帆推出全新视觉理解模型Qianfan - VL并全面开源,含3B、8B和70B三个版本,基于自研昆仑芯P800计算。它特点多、性能优,应用场景广,未来还将推新产业级模型。