「应用商店优化」共找到 3233 篇相关文章
【博客转载】CUDA Local Memory
文章围绕CUDA本地内存展开,介绍其为线程私有存储空间,访问特性与全局内存类似。通过两个计算滑动平均值的CUDA kernel示例,展示数组索引复杂度对存储位置的影响,还给出判断存储位置的方法及优化建议。
LLM近期重大架构进化一览:从Gemma 4到DeepSeek V4
近期大模型长上下文需求增长,成本问题凸显。Google Gemma 4、Poolside Laguna XS.2、Zyphra ZAYA1 - 8B、DeepSeek V4 等模型各有架构优化,如 Gemma 4 跨层 KV 共享和 PLE,以降低长上下文推理成本。
兵临OpenAI!谷歌集结2500人「复仇」,Gemini 3夺回AI王座
谷歌发布Gemini 3欲夺回AI主导权。谷歌DeepMind的CTO与AI Studio产品负责人剖析其发布盛况等,称这是与全球用户共建AGI的实验,还谈到模型发展、应用及多模态等问题,也承认仍有提升空间。
马斯克想要「杀死」氛围编程,就像FSD搞定自动驾驶
马斯克在X平台称xAI将消除氛围编程,让它回归纯粹编程,能按描述制作应用。氛围编程借助AI根据自然语言指令自动生成代码,若xAI愿景成真,软件开发范式或转变,程序员工作模式也将改变。
获NVIDIA致谢:悟空Agent的实践、复盘与迭代
本文以悟空Agent获NVIDIA致谢为切入点,介绍多智能体架构闭环及实战挑战,如上下文断流、调度失衡。还阐述架构设计、迭代优化、数据飞轮体系,指出AI infra存在安全隐患,强调安全融入业务的重要性。
上海交大团队发布首篇「搜索智能体」综述!四个维度深度剖析搜索智能体
上海交大团队发布首篇「搜索智能体」综述,从如何搜索、优化、应用、评估四个维度剖析。随着LLM兴起,搜索从传统模式向搜索智能体转变,虽有潜力但缺统一研究视角与评估框架,该综述提供了路线图。
PyTorch博客翻译 Accelerating Generative AI Part III: Diffusion, Fast
这篇博客介绍用纯原生 PyTorch 技术将文本到图像的 diffusion 模型(特别是 Stable Diffusion XL)推理速度提升高达 3 倍的方法,讲解五种优化技术,还验证了方法在其他 diffusion 模型上的通用性和有效性。
加一个JVM参数,让系统可用率从95%提高到99.995%
文章针对高并发系统不稳定问题,定位是系统内存索引切换时 GC 压力大所致。围绕让索引尽早晋升、直接分配到老年代等思路探索优化,经多番尝试,最终实现索引无感切换,使系统可用率达 99.995%。
首发Omni-Flow流式全模态架构,消费级显卡就能跑
面壁智能等联合发布MiniCPM-o 4.5技术报告,公开Omni-Flow流式全模态框架。该模型凭9B参数实现端到端全双工全模态,可在消费级显卡运行,还推出在线体验Demo等,性能表现佳,应用潜力大。
消费级显卡跑大模型训练门槛再降:Qwen3-1.7B强化学习只需5GB显存
消费级显卡跑大模型训练门槛再降,Unsloth AI的FP8精度强化学习方案让Qwen3 - 1.7B的GRPO训练只需5GB显存且性能无损。该方案与TorchAO合作,有推理优势,还在内存优化等方面表现出色。