「性能测试」共找到 3305 篇相关文章
如何将LLM的"思考习惯"迁移到视觉领域?
传统多模态模型处理复杂视觉推理能力不足,OVR团队以Qwen2.5 - VL - 7B为基础构建开源强化学习框架,成果模型OVR在12个基准测试刷新记录,揭示认知行为跨模态迁移三条黄金定律。
ICML 2025 | 西湖大学吴泰霖研究员团队:组合生成式多物理场多元件PDE仿真
西湖大学吴泰霖课题组联合多方提出“组合生成式多物理场多元件PDE仿真(M2PDE)”,将仿真问题视为生成式概率建模任务。该成果在多任务测试中表现卓越,被ICML 2025接收。
AI能否「圣地巡礼」?多模态大模型全新评估基准VIR-Bench来了
来自日本高校和企业团队提出多模态大模型评估基准 VIR-Bench,用于评测 AI 对旅行视频中地理位置与时间顺序的理解。它将任务拆解,构建数据集,实验显示模型虽有改进但性能远未达标,指明了大模型进化方向。
刚刚,英伟达祭出下一代GPU!狂飙百万token巨兽,投1亿爆赚50亿
昨天,英伟达发布专为海量上下文AI打造的CUDA GPU——Rubin CPX,将大模型推理带入「百万Token时代」。它性能强大,能带来高回报,可重写推理经济,还将得到英伟达全栈AI生态支持,预计2026年底可用。
硅谷大佬带头弃用 OpenAI、“倒戈”Kimi K2!直呼“太便宜了”,白宫首位 AI 主管也劝不住
硅谷似乎正从昂贵闭源模型转向便宜开源替代方案。“SPAC 之王”Chamath Palihapitiya 团队将大量工作负载迁移至 Groq 平台的中国模型 Kimi K2,因其性能优且价格低。节目还探讨了中国开源 AI 模型给美国带来的压力。
一个月的活一周干完!英伟达世界模型训练速度飙升400%
英伟达世界动作模型 DreamZero 训练成本高、耗时长,无问芯穹与清华等推出的 RLinf 框架,从算子融合到 I/O 全链路系统级重构,使训练吞吐拉高近 4 倍,还解决多类性能瓶颈,保证训练效果。
不吹不黑,在Agent任务上,kimi 2.6确实让我忘了Claude。
Kimi K2.6发布并开源,代码和Agent能力提升。作者测试发现,它在部署Claude Code源码、网站生成、多智能体任务等方面表现出色,审美提升,思维活跃,还能复刻文档风格,开源释放了前沿编程能力。
RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26
RAG是大模型落地标配技术,但存在搜到文档却答错的痛点。德国萨尔大学等团队提出Disco - RAG框架,在‘搜’和‘答’间加入‘读懂’环节,已被ACL 2026主会录用,在多基准测试表现优异。
五百行代码打造SOTA视觉智能体!UniPat AI最新开源
多模态大模型代码能力强,但基础视觉任务常失误。UniPat AI推出极简视觉智能体框架SWE-Vision,让模型用代码弥补视觉短板,在五个主流视觉基准测试达最优。该框架设计独特,开源代码和数据已发布。
告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆
中国人民大学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。