「性能评测」共找到 2468 篇相关文章
性能提升84%-166%!L-Zero仅靠强化学习解锁大模型探索世界的能力 | 已开源
招商局狮子山人工智能实验室团队用RLVR让模型“自学”,构建L0系统,含NB - Agent框架和端到端强化学习训练流程,开源相关内容。测试显示L0显著提升模型性能,展现强大泛化能力。
南大团队直击大模型高分神话:人类90分,最强模型仅49分
南京大学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距大,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。
OpenAI携手五巨头开源革命性超算协议:一举解决超大集群LLM训练不稳定和网络性能难题
OpenAI联合英伟达等五巨头推出超算开放网络协议MRC并正式向行业开放。MRC目标是性能可预期,有多平面网络、自适应包喷射、SRv6源路由三大核心机制,已在OpenAI多台超级计算机上部署。
Agent KB:经验池让Agents互相学习!GAIA新开源SOTA,Pass@1性能最高提升6.66
来自多家机构团队发布 Agent KB 框架,构建经验池实现 AI Agent 经验共享。在 GAIA 基准测试中表现出色,提升多模型 Pass@1 性能,还在软件工程领域展现价值。其设计精妙,经消融、检索策略等实验验证有效。
腾讯混元AI Infra如何优化Hy3 Preview:一次大模型推理性能提升的技术拆解
文章聚焦腾讯混元AI Infra对Hy3 preview模型的推理性能优化。从算子优化与融合、并行策略等五大维度,剖析技术思路、算法及收益,如Attention算子单batch长文本最高加速2.95x,还提及后续显存优化等工作。
普林斯顿等高校提出AgentDistill:无需任何训练即可继承大Agent复杂能力,性能提升48%,成本降低90%
在AI领域,大型语言模型智能体计算需求大限制部署,传统蒸馏技术对智能体效果有限。AgentDistill提出解决方案,让学生智能体复用教师智能体的MCP工具包,无需训练继承复杂能力,小模型性能显著提升。
超越免训练剪枝:LightVLA引入可微分token剪枝,首次实现VLA模型性能和效率的双重突破
文章介绍LightVLA框架,它是用于提升VLA推理效率和性能的视觉token剪枝框架。针对VLA模型计算开销大、推理延迟高问题,提出两大创新,在LIBERO实验中性能超经典模型,还实现推理加速。
杀疯了!单卡4090跑通全量微调,面壁1B级多模态性能怪兽硬刚大厂
面壁智能推出MiniCPM-V 4.6,参数约1B,性能和推理效率出色。它在多模态任务综合能力、推理速度上领先竞品,靠ViT架构改造和4倍/16倍混合视觉Token压缩实现创新,有工业验证,对开发者和普通用户意义大。
Embodied Arena:业界首个统一具身大脑评测平台重磅发布,30+模型全面对比揭示关键洞察
具身智能火热,研究者常感茫然。Embodied Arena评测平台上线,它全面统一且持续演进,涵盖22+基准测试和30+模型,构建评估体系,揭示关键洞察,为具身模型发展指引方向。
阿里云飞天企业版X平头哥“真武”芯片,推理性能跃迁13倍,底层逻辑是什么?| Q推荐
过去几年,模型虽强但使用成本高,阻碍企业级AI深度应用。今年‘模型推理’成AI关键词,4月13日19:00,InfoQ联合阿里云邀专家围绕推理加速底层破局展开对话,探讨算力博弈、芯片性能跃迁等问题。