「L20 GPU」共找到 834 篇相关文章
1.93bit版DeepSeek-R1编程超过Claude 4 Sonnet,不用GPU也能运行
1.93bit量化后的DeepSeek - R1(0528)编程能力超Claude 4 Sonnet,在aider榜单获60分。Unsloth工作室制作9个量化版本,小版本不用GPU也能跑。R1 - 0528在游戏评测中表现也佳。
20人团队提前实现DeepSeek构想,AI算力变天?直击大模型算力成本痛点
国内20人玉盘AI团队推出SRDA全新计算架构方案,试图从硬件源头解决当前AI算力核心瓶颈。该架构有诸多创新设计,能应对大模型训推痛点,与DeepSeek构想契合,或成大模型专用架构分水岭。
昇腾+鲲鹏联手上大招!华为爆改MoE训练,吞吐再飙升20%,内存省70%
最近华为在MoE训练系统给出算子和内存优化新方案,三大核心算子全面提速,系统吞吐再提20%,Selective R/S实现内存节省70%,为大规模MoE模型训练扫清障碍。
1万块GPU砸向欧洲!老黄怒怼AI末日论:全球首个工业AI云来了
巴黎GTC大会上,黄仁勋表示AI是伟大平等工具,驳斥AI致大裁员预测。英伟达卖1万块GPU建工业AI云,还宣布DGX Lepton项目。此外回顾AI发展,从感知到具身智能,介绍其应用及加速计算等成果。
首个国产OpenClaw硬件产品即将发布,插电脑上就能用,使用成本降低20倍。
OpenClaw带火了Agent,但行业后续要解决落地问题,如控成本、降门槛等。Violoop团队实力强、融资快,4月将预售。其产品云端与端侧结合,通过原生接入、端侧处理等解决落地难题,成本降20倍以上。
DeepSeek重磅开源3B OCR模型,一天处理20万页文档!一天内斩获6K标星!
DeepSeek开源3B OCR模型DeepSeek - OCR,参数量仅30亿,单张A100 - 40G一天能处理20万页文档,不到24小时获6K标星。它是视觉压缩引擎,解决大模型处理长文本算力爆炸问题,有诸多技术亮点。
阿里又上新!开源 7B 文生图模型,专治图中文字,效果媲美 20B+ 大模型!
阿里 AIDC - AI 团队开源 7B 参数文生图模型 Ovis - Image,主打图中文字生成。它文本渲染能力强,在权威榜单成绩好,媲美 20B + 大模型,官方还提供使用方法,是设计类刚需模型。
Cursor已死,Claude当立!Anthropic用L4级Agent,正在“降维打击”整个AI编程赛道。
AI编程领域正上演变革,很多用户从Cursor转向Claude Code。Claude Code成本有优势且具L4级编程能力,其强大还冲击了生态。未来Agentic DevOps是黄金赛道,最终赢家或为有顶尖模型与云服务的玩家。
让GPU不再摸鱼!清华蚂蚁联合开源首个全异步RL,一夜击穿14B SOTA
清华与蚂蚁联合开源AReaL - boba²,实现全异步强化学习训练系统,解耦模型生成与训练流程,大幅提升GPU利用率。14B模型在多个代码基准测试达SOTA,性能接近235B模型。
颠覆法律行业!Anthropic一口气发布20+款MCP连接器,从合同审查到法庭诉讼全覆盖
Anthropic面向法律行业推出超20款新MCP连接器及12个专业插件,从底层打通法律技术栈。Claude可在办公软件中工作,覆盖合同审查到法庭诉讼等场景,还与多机构合作让法律服务更普及。