「性能测试」共找到 3298 篇相关文章
阿里云Tair KVCache仿真分析:高精度的计算和缓存模拟设计与实现
阿里云Tair KVCache团队推出Tair - KVCache - HiSim,这是面向分布式多级KVCache管理的高保真LLM推理仿真分析工具。它能在通用CPU上高精度预测性能,支撑计算选型、存储规划和调度协同等决策,还介绍了其架构、组件、验证及性能评估等内容。
FlashAttention 完全进化史:FA-4 发布之际的技术全景回顾
文章围绕FlashAttention展开,从Attention性能瓶颈引出问题,阐述其各版本演进。FA-1实现算法突破,避免O(N²)内存;FA-2适配架构,提升性能;FA-3深度协同,实现异步;FA-4探索更深异步和角色分工。还探讨跨芯片迁移及未来优化方向。
库克清空弹夹!2nm,韬定律,最强AI电脑
库克退休前火力全开,苹果发布首款2nm制程芯片M6和最强M系芯片M5 Ultra,塞进新款Mac。M6让Mac mini AI性能暴涨,M5 Ultra性能强悍,能跑大模型。但因内存短缺,高内存版限购且供货晚,价格也涨了。
阿里最新开源王炸Agent!性能全面SOTA!
阿里WebAgent更新频繁,基本一月一版。它是类似DeepResearch的通用智能体,历经WebWalker到WebWatcher多阶段演进,各阶段解决不同问题,如网页导航、自主信息搜集等,还不断优化训练数据生成与处理方式。
Claude团队用Qwen测试全新训练方法
Anthropic最新研究提出中训练(MSM),在预训练后、后训练前给AI立规矩。实验显示,新增MSM能让通义千问两款32B大模型失准率大幅下降,还能精简微调数据。MSM与对齐微调结合,可提升模型泛化能力。
大模型如何赋能 Web 渗透测试?
文章指出传统Web安全检测有局限,而大语言模型(LLM)可提升漏洞发现覆盖率与准确性。以mcp server为基础介绍自动化漏洞检测方案,还分享实践操作、遇到的问题及解决办法,分析其优缺点并给出拓展思路。
Agent性能暴涨90%,刷榜GAIA可太容易了~
今年AI Agent层出不穷,当前研究缺乏统一标准、复现难。oppo Agent团队分享构建高效Agent的关键组件及刷榜GAIA的方法,从事实获取能力和逻辑推理保真度两维度分析,介绍了强化感知和提升思维的策略。
复杂空间推理新SOTA,性能提升55%!中山大学新作SpatialDreamer
中山大学等机构推出SpatialDreamer,模拟人类空间认知过程,构建闭环推理流程,还提出GeoPO解决奖励稀疏问题,构建SpatialDreamer - SFT数据集。实验显示其在多基准达SOTA,为AI空间智能发展开辟新路径。
Anthropic官方解密:3招上下文优化,破解Agent性能暴跌
本文是Anthropic官方文章翻译,从提示词工程拓展到上下文工程,阐述其构建方法。介绍上下文工程对构建智能体的重要性、上下文构成,还提及上下文检索、智能体搜索及长期任务的上下文工程解决方案。
The Batch: 920 | Nano Banana 2 在性能/价格比方面实现提升
Google发布Nano Banana 2(正式名称Gemini 3.1 Flash Image),是图像生成系统。它速度快约4倍、成本减半,支持多功能,在多个排行榜中位列前三,以低价接近文字 - 图片排行榜领先位置。