「模型能力提升」共找到 10018 篇相关文章
十万卡,不是把十万张GPU插在一起
本文拆解十万卡GPU集群的核心痛点,指出其难点并非硬件堆叠,而是系统调度、稳定性等工程能力,介绍摩尔线程全栈布局及与京东云合作打造国产十万卡集群的行业信号。
快去提问!沐神空降小红书,在线答疑
本文整理了深度学习大牛李沐(沐神)在小红书开展的AMA答疑内容,覆盖AI学习、职业方向、技术趋势、行业赛道等大众关心的热门问题,给出了直白干货的回答,适合AI从业者、学生参考。
1GW算力中心耗资600亿美元?黄仁勋G20现场布道“AI经济学”
美国当地时间9月2日,英伟达CEO黄仁勋在G20创新部长级会议阐述‘算力经济学’。他称建1GW规模AI基建约需500 - 600亿美元,算力成国家级核心生产资料,全球到2030年AI基建或达100GW。
一个「流浪」数学家的遗产,正在被AI公司疯抢
2026年,OpenAI等公司用AI解决多个匈牙利数学家Paul Erdős提出的问题,震动数学界。这些问题分布广、难度跨度大,适合模型测试。不过,AI证明的验证和人类数学家地位受关注。
Cloudflare 推出 Meerkat,实现全球强一致性协调
Cloudflare推出基于QuePaxa共识算法的Meerkat服务,可无领导者写入并保持强一致性,提升网络可用性。虽有往返通信代价且非通用数据系统,但优化对强一致性系统重要,还未投入生产。
kimi K3超大杯升级背后的技术内幕
文章介绍开源模型 K3 架构设计思路。主要探讨 MoE 和 MLA 部分,在 MoE 方面提出 SiTU、Norm、QB 改进;在注意力机制选择 MLA,与 KDA 混合缓解部分问题,还谈及 DSV4、NoPE 相关特点。
离大谱!15k Star book-to-skill,我惊到了!!!
book-to-skill是将书籍、文档目录或多份资料转换成Agent Skill的命令行工具。它把资料拆成可按需加载的知识资产,有按需加载章节等优势,适合将常用知识编译成技能,不过也有一定局限性。
Claude Opus 5 发布,比 Fable 5 强,仅一半价格
Claude Opus 5发布,官方称其以一半价格提供接近Fable 5的智能。跑分显示它多数项目超Fable 5,ARC - AGI - 3成绩突出,还更省token,是Anthropic迄今对齐度最高的模型。
4.8K Star!一套面向设计工程师的 AI 编码智能体 UI 技能集合!
前端开发中AI生成代码质量参差不齐,ui - skills项目应运而生。它由开发者ibelick创建,是面向设计工程师的UI技能集合,将开发经验转化为规则,通过CLI工具让AI按规则构建和审查代码,已获4.8k Stars。
小米罗福莉:MiMo-V2.5如何做到又快又强又便宜? | ICML 2026
2026年7月ICML大会上,小米MiMo团队负责人罗福莉介绍MiMo - V2.5系列。该系列跳出传统思路,从架构、训练、推理协同设计,实现“聪明、快速、便宜”,如预训练降成本、后训练有硬核算法、推理加速达1000 TPS。