「加速计算」共找到 1222 篇相关文章
SGLang 优化Triton FusedMoE 的一个新技巧
蚂蚁在SGLang中提交优化PR,针对Fused Triton MoE的Down Projection kernel加入TMA优化,在DeepSeek - R1模型的H200 TP8 prefill场景下性能提升显著,还详细分析了优化背景、思路、实现细节及测试结果。
为什么说开发者参与鸿蒙生态共建是“恰逢其时”?
文章指出开发者参与鸿蒙生态共建恰逢其时。当前人均设备多,鸿蒙打破旧规则,生态加速生长。HarmonyOS开发者技术分论坛展示新机遇,介绍其开发能力、适配方案等,还阐述生态开放性与开源精神。
Glyph:文本转图片解决长上下文困境,智谱把“DeepSeek-OCR”具像化了
传统 token 扩展方式遇算力成本天花板,DeepSeek 与智谱都想到让 AI“看”文字思路。智谱发布 Glyph 框架工程化实现此思路,将文本转图片处理,降低计算成本,有不错效果但也存在排版敏感等限制。
零一万物高管新阵容亮相,李开复加码布局ToB 2.0
零一万物ToB战略加速落地,公布新一轮高管任命,沈鹏飞、赵斌强、宁宁三位核心管理者亮相。其“一把手工程”依托万智平台,已覆盖多行业,在国内外均有合作成果,目标是让AI成企业转型推动者。
OpenAI两位首席最新采访信息量好大!终极目标是“自动化研究员”,招人并非寻找“最出圈”的人
OpenAI首席科学家Jakub Pachocki和首席研究官Mark Chen在采访中爆料,谈到GPT - 5将推理引入主流、实现自动化研究员目标、强化学习未到瓶颈等,还阐述用人标准、算力分配等问题。
图灵得主Yoshua Bengio,开始警惕AI有意识了
图灵得主Yoshua Bengio和学生在Science发文探讨AI意识问题。文章未明确AI是否有意识,而是讨论科学界和公众信念的演变及把AI当有意识生命体的风险,还提及计算功能主义等相关理论。
Meta最新REFRAG框架引爆RAG圈!KV缓存暴降90%,速度狂飙30×
Meta推出REFRAG框架解决RAG难题。它能在不修改解码器参数下压缩上下文、复用文档向量等。实验显示,它降低KV缓存、加速TTFT,在多任务表现佳,为大模型与知识库结合提供新范式。
OpenAI 发布公司领导者 AI 行动指南,助力企业发展
OpenAI 2024 年走访超 200 家营收 10 亿美元企业,发现拖慢 AI 落地的是‘领导层叙事缺口’。结合客户实践,总结出对齐、激活、放大、加速、治理 5 个可落地步骤,助企业构建以 AI 为核心的组织。
AI生成苹果Metal内核,PyTorch推理速度提升87%
Gimlet Labs研究显示,AI能自动生成苹果芯片Metal内核,使PyTorch推理速度提升87%,在215个PyTorch模块上平均加速1.87倍。多个模型组合生成最优内核概率更高,不过研究对比方式遭质疑。
通用LLM压缩算法,居然藏视频编码里!2.5bit实现4bit性能,硬件无缝支持
LLM.265研究发现,视频编码器是高效的大模型张量编码器,现成视频编解码硬件压缩AI模型数据效率高。它灵活控制码率、可压缩多种张量,还能利用GPU硬件加速。实验显示其压缩效果显著。