「并行加速」共找到 824 篇相关文章
QClaw V2 升级:微信里直接用的龙虾,真正走入你生活和工作的个人助理
3月8日QClaw发布后文章爆火,近期产品迭代快。QClaw V2引入Multi - Agent机制,可创建多角色AI助手并行工作,还能连接主流办公工具,集成龙虾管家保障安全,实测功能强大,优势明显。
【博客转载】CUDA Kernel Execution Overlap
文章讨论CUDA kernel执行重叠,指出有足够计算资源时可重叠,通过调整`blocks_per_grid`值,观察到不同并行化程度。还提到隐式同步会影响重叠,可启用`per-thread` default Stream 禁用。
北大校友、OpenAI前安全副总裁Lilian Weng关于模型的新思考:Why We Think
北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算研究进展,探讨激励模型思考方式,介绍思维链、并行采样、序列修订等策略,还提及强化学习、外部工具使用及未来研究方向。
382人、平均95后,MiniMax百亿估值冲刺IPO!招股书首次披露业绩:研发成本仅为OpenAI的1%、收入猛增8倍
12月21日,通用人工智能公司MiniMax通过港交所上市聆讯。其员工年轻,研发成本仅为OpenAI的1%,收入猛增,产品覆盖多模态。此次聆讯或倒逼行业转向“经营叙事”,加速行业分化。
扎克伯格急了!Meta内部文件曝光:宁用竞品,也要废掉祖传系统
Meta的「超级智能实验室」发起内部革命,加速AI开发。扎克伯格豪赌AI,投巨资重组团队、吸引人才。内部文件显示,Meta强制员工用AI,还让员工弃自研系统,用Vercel等平台。
GPU为什么能取代CPU,成为计算领域无可争议的核心?
过去CPU是计算核心,如今GPU凭借并行处理能力崛起。在人工智能、大数据等领域,GPU优势明显,软件支持也推动其普及。未来,GPU将在更多领域发挥作用,还会与CPU融合。
直接免单!阿里千问30亿请客吃喝玩乐,春节AI大战彻底白热化
阿里千问APP官宣砸30亿开启「春节请客计划」,2月6日起以「免单」请全国人民吃喝玩乐,阿里生态「全家桶」加入。千问已接入阿里生态,借补贴加速AI Agent普及,有望凭「免单+服务」成「生活万事通」。
8亿!OpenAI发布企业AI现状报告
OpenAI发布《2025年企业AI现状报告》,基于真实数据与调研公开企业级AI使用规模。ChatGPT周服务超8亿用户,企业端增长惊人,各行业渗透加速,员工也感受到实际价值,同时前沿与普通用户差距拉大。
[Triton编程][基础]vLLM Triton Merge Attention States Kernel详解
文章详细介绍vLLM中Triton Merge Attention States Kernel的实现,与PyTorch原生实现对比,该Triton kernel最高可实现3 - 5倍以上算子加速。内容涵盖Merge Attention States概念、PyTorch实现、Triton基础算子、分析及性能评估等。
谷歌新论文把内存股价干崩了!KV cache压缩6倍,“谷歌的DeepSeek时刻”
谷歌研究院推出TurboQuant压缩算法,可将AI推理中最吃内存的KV cache压缩至少6倍且精度零损失,还能8倍加速计算。虽引发存储芯片巨头股价下跌,但目前只是实验室成果,仅解决推理阶段内存问题。