「推理性能优化」共找到 4188 篇相关文章
GPT‑5深夜发布:模型之战结束,Agent之战开始!
昨晚,炒作一月的GPT - 5正式发布,标志原生Agent时代到来。体验显示其压低幻觉、提升指令遵循与推理能力。文中还对比了GPT - 5、Gemini、Claude等模型在不同场景表现,指出御三家路线分化及三条反常识判断。
大模型能力,小模型成本!Google等 | 提出递归混合框架:MoR, 大幅提升LLM计算效率
Google提出递归混合框架(MoR),融合参数共享与自适应计算。它有轻量级路由和KV缓存策略,在不同路由机制各有优劣。实验显示,MoR在性能、计算和内存效率上表现出色,有望实现“大模型能力,小模型成本”。
One RL to See Them All?一个强化学习统一视觉-语言任务!
国内初创公司 MiniMax 提出 V-Triune 系统,可让 VLM 单一训练流程学视觉推理和感知任务。它含三个组件与动态 IoU 奖励机制,基于此的 Orsta 模型在多项测试中性能提升显著,凸显统一 RL 方法有效性和可扩展性。
供需失衡的窗口期里,商汤大装置把国产算力做成了正毛利生意
WAIC期间,商汤大装置举办AI基础设施论坛,展示国产算力成绩单,将国产芯片业务毛利率做到正数。其通过异构混合推理等操作方法论,提升芯片利用率,还在多领域合作,虽红利或收窄,但方法论有长期价值。
企业级OpenClaw最强拍档来了!万亿参数的国产多模态大模型,刚刚开源发布
YuanLab.ai团队开源源Yuan3.0 Ultra多模态基础大模型,是万亿级开源多模态大模型之一。它优化训练效率,在多任务表现突出,为企业Agent AI提供支撑,还提出新算法和训练策略,全面开源推动落地。
AI 驱动的大数据自治:TCInsight 智能应对复杂运维挑战
在大数据平台高速发展下,传统专家运维模式难应对复杂问题。腾讯专家工程师熊训德介绍大数据智能管家 TCInsight,其架构分三层,结合规则与专家系统提升自治能力,还分享实践案例,指出后续待优化方向。
142 TFLOPS 的差距:为什么在 Blackwell 上 FP4 MoE 算子工程至关重要
文章对三种主流MoE后端在Blackwell B200 GPU上做基准测试,发现SGLang与vLLM有142 TFLOPS差距,小batch时SGLang快1.84×。差异源于kernel融合、面向Blackwell的CUTLASS schedule及自适应grid sizing等优化。
从静态模型到数字生命体:自进化AI Agent综述
近年大型语言模型催生AI智能体发展,但现有系统依赖人工预设,难适应动态环境。论文提出自进化AI智能体,可通过环境反馈自动优化,还提出三定律、四阶段范式演进模型等,开源EvoAgentX框架。
内幕曝光:OpenAI模型坦承不会第六题,3人俩月拿下IMO金牌!
OpenAI三人团队俩月让AI达IMO金牌水平。他们用多智能体系统技术,使模型能短时间解复杂问题。新模型有自省能力,减少“幻觉”问题。此次突破是通用推理技术进步,未来将整合进更多模型。
8种LLM架构设计大比拼:从 DeepSeek-V3 到 Kimi K2,究竟有啥不同
文章对比了8种LLM架构设计,如DeepSeek-V3、OLMo 2等。介绍各模型关键技术,像DeepSeek-V3的多头潜在注意力和混合专家架构,还分析不同设计对性能、效率的影响,助读者了解LLM架构差异。