「性能模型」共找到 8424 篇相关文章
开箱即用、本地安全、多 Agent 协同解决方案!
过去一年,Agent热度高,但企业应用面临算力、安全和部署门槛。5月22日浪潮信息推出元脑智能体工作站Z3,整合大模型本地推理等功能,解决本地多Agent运行问题,降低使用门槛,保障安全。
Agent-World:扩展真实世界环境,让智能体与环境协同进化!
文章提出Agent-World,将“智能体环境探索”与“自进化训练”结合,构建了1978个环境、19822个工具。实验表明,其在23个基准上一致性优于先进方法与强开源基础模型,还分析了环境规模与自进化对性能的影响。
腾讯Youtu-agent 不会代码,也能搞定数据分析+深度研究+HTML报告
腾讯开源的Agent框架Youtu - agent灵活高性能,可用于数据分析等多任务。基于openai - agents构建,适配多种模型API等。突出优势是能自动化生成智能体及其配置,采用YAML配置方案,有内置‘元智能体’,还完全异步。
时隔六年,OpenAI 为什么再次开源?
OpenAI发布两款开源纯文本推理模型,时隔六年再次开源。其gpt - oss - 120b性能与o4 mini相当,成本降超10倍。此次开源有战略考量,或是为构建生态、吸引企业,也反映出其对自身价值定位更清晰。
TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法
北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。
智能体新范式Chain-of-Agents,多项任务新SOTA
论文提出Chain-of-Agents (CoA) 范式,结合多智能体系统与工具集成推理优势。通过多智能体蒸馏和智能体强化学习训练智能体基础模型(AFM),实验显示其在Web和Code任务上达新SOTA,效率、泛化性佳。
KV-Cache 实战策略:生产环境中的分页、固定与复用技术解析
在大语言模型推理场景中,KV - Cache 是平衡性能与成本的核心技术,但生产环境中面临诸多问题。本文聚焦其分页、固定与复用三大战术,结合原理、实践与案例,为开发者提供解决方案,还探讨了未来演进方向。
智能体的记忆管理机制及其潜在风险 | 直播预约
大语言模型(LLM)智能体兴起,记忆机制是核心。本次报告将探讨记忆管理对其性能的影响及潜在风险,展示缓解关键挑战的策略,介绍新攻击范式,揭示安全漏洞,强调需重新审视与建模。
超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26
大语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。
刚刚,英伟达祭出下一代GPU!狂飙百万token巨兽,投1亿爆赚50亿
昨天,英伟达发布专为海量上下文AI打造的CUDA GPU——Rubin CPX,将大模型推理带入「百万Token时代」。它性能强大,能带来高回报,可重写推理经济,还将得到英伟达全栈AI生态支持,预计2026年底可用。