「测试时路由框架」共找到 3161 篇相关文章
ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力
最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。
The Batch: 864 | GLM-4.5:一款开放的智能体竞争者
大型语言模型推动智能体能力交互竞赛正酣,中国 Z.ai 推出 GLM - 4.5 系列开源权重模型,在推理、编程等基准测试中表现出色,还介绍了其工作原理、研究和测试结果等。
让大模型学会「心灵感应」:基于思维沟通的多智能体合作范式来了
NeurIPS 2025的论文提出思维沟通概念,建立潜在思维可识别性理论,构建ThoughtComm框架。该框架让模型共享潜在思维,跳过语言冗余歧义,实验显示其提升了协作效率与推理能力,或开启新智能形态。
国产模型新盛况!王座易主:Kimi K2 Thinking开源超闭源
月之暗面开源 Kimi K2 Thinking 模型,多方面性能超 GPT - 5 等闭源模型。它擅长多轮调用工具和持续思考,在多项基准测试达 SOTA 水平,成本低且授权宽松,引发全网讨论。
字节开源图像生成“六边形战士”,一个模型搞定人物/主体/风格保持
字节UXO团队设计并开源统一框架USO,解决图像生成多指标一致性问题。它能统一看似孤立任务,实现单任务和组合任务的SOTA,弥补了主体保持和风格迁移短板,性能领先,还采用新范式及算法。
腾讯AI Lab开源可复现的深度研究智能体,最大限度降低外部依赖
腾讯AI Lab推出全开源智能体框架Cognitive Kernel - Pro,解决现有开源框架依赖付费工具问题。它有模块化架构等核心设计,创新训练方法,在多任务中表现出色,降低外部依赖,相关论文登HuggingFace热榜。
别再只关注KV Cache了! LLM稀疏性新洞察:为何模型越深越稀疏?UNCOMP从矩阵熵给出答案
团队论文UNCOMP获EMNLP 2025主会接收,它提出高效推理框架,从截断矩阵熵视角解释LLM深层稀疏现象。还能识别关键结构、找到最优压缩策略,设计的UNCOMP框架优化KV Cache,实验效果佳。
超越免训练剪枝:LightVLA引入可微分token剪枝,首次实现VLA模型性能和效率的双重突破
文章介绍LightVLA框架,它是用于提升VLA推理效率和性能的视觉token剪枝框架。针对VLA模型计算开销大、推理延迟高问题,提出两大创新,在LIBERO实验中性能超经典模型,还实现推理加速。
LLM工业级自进化:北邮与腾讯AI Lab提出MoE-CL架构,解决大模型持续学习核心痛点
北邮百家AI团队与腾讯AILab提出MoE - CL架构用于LLM自进化持续指令微调。其结合‘解耦LoRA专家’与‘GAN对抗降噪’,在腾讯业务及基准测试中效果佳,降低人工成本,准确率优于主流方法。
GPT-5仅23.3%,全球AI集体挂科!地狱级编程考试,夺金神话破灭
最新基准测试SWE-Bench Pro评估AI编程智能体,直面真实企业级工程任务。顶尖模型几乎溃败,GPT - 5仅23.3%。该测试解决现有基准数据污染、任务简单问题,能成未来LLM编码能力标尺。