「小模型推理能力」共找到 9230 篇相关文章
大模型哪里出问题、怎么修,这篇可解释性综述一次讲清
来自多机构的研究团队发布“可实践的机制可解释性”综述,通过 'Locate, Steer, and Improve' 三阶段范式,为大模型的对齐、能力增强和效率提升提供方法论,还梳理可解释对象体系和干预手段。
OpenAI发长文自曝家丑:搞砸了GPT-4o更新,模型“拍马屁”复盘与总结
OpenAI官网发布长文,详细拆解了一次失败的GPT-4o模型更新。此次更新使模型变得“谄媚”,OpenAI解释了原因,包括奖励信号失衡等。还分析了部署前评审流程失效的因素,并表示从中学到诸多经验教训,将修改评审流程等。
MoE不够看了,腾讯推出MoT:2B具身模型22项评测16项最佳
腾讯混元团队联合Robotics X实验室推出HY - Embodied - 0.5系列基础模型,含MoT - 2B和MoE - 32B两款主力模型。在22项评测中,MoT - 2B获16项最佳,其架构、数据和训练有创新,能应用于机器人控制。
Karpathy自称患上AI精神病!能力没有上限,一切都是Skill问题
Karpathy在播客中称自己患AI精神病,日常工作多依赖智能体。他认为智能体能力无上限,瓶颈在使用者技能。还探讨软件变革、自动化研究、模型分化等,对就业、开源等也给出看法。
登顶多模态推理榜MMMU!UCSD新方法超越GPT-5、Gemini
加州大学圣地亚哥分校团队开发的DreamPRM-1.5在MMMU测评榜夺冠,超越GPT-5、Gemini 2.5 Pro Deep-Think。它细化加权粒度到样本,有Instance Table和Instance Net架构,采用双层优化与生成式奖励模型。
ERNIE 5.0:走向原生统一的万亿参数多模态基础模型
过去多模态模型‘拼接式’方案存在理解与生成割裂问题,ERNIE 5.0 借此提出,用统一自回归框架做多模态理解与生成,在架构、训练与系统层面有创新,评测中各模态能力表现出色。
重磅!谷歌开放世界模型Genie 3试用:AI实时生成可玩世界,人人都能创造“我的世界”
谷歌开放世界模型Genie 3实验性研究原型Project Genie试用,美国18岁以上Google AI Ultra订阅用户可体验,能创建、探索和重混互动世界,不过Genie 3是早期研究模型,有待改进之处。
微软深夜发布SambaY架构,Phi-4min加速10倍推理
微软基于Phi-4-mini版本,针对特定推理任务微调出Phi-4-mini-Flash-Reasoning 3B模型,将其扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行快10倍,有诸多优点。
不用千亿参数也能合成高质量数据!这个开源框架让小模型“组团逆袭”,7B性能直追72B
上海人工智能实验室与中国人民大学提出GRA框架,以“多人协作”理念让小模型分工生成高质量训练数据。实验显示其生成数据质量高,项目已开源。它打破对大模型蒸馏依赖,展现“集体智能”潜力。
清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座
清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。