「开源小模型」共找到 9172 篇相关文章
告别昂贵人工标注,英伟达全自动视频理解助力小模型逆袭顶级大模型
麻省理工、英伟达等推出FoundationMotion,它是全自动数据生成流水线,能解决运动数据稀缺难题。通过自动标注生成问答数据,让小模型经微调后在运动理解上超越顶尖闭源模型,还介绍了其数据生成、问答设计等环节。
英伟达揭示RL Scaling魔力!训练步数翻倍=推理能力质变,小模型突破推理极限
学界对强化学习能否让模型学会新推理技能争论已久,过去研究多悲观。英伟达研究指出,问题源于任务在基础模型训练数据中过度呈现及训练步数不足。其ProRL框架提升训练步数,释放小模型潜力,还构建技术组合拳。
开源模型TOP5,被中国厂商包圆了
10月公开数据显示中国开源大模型占据榜单前五,阿里Qwen系列和DeepSeek影响力深远。从LMArena榜单、HuggingFace数据看,国产模型表现佳。还提及Llama 5相关传闻。
4B小模型数学推理首超Claude 4,700步RL训练逼近235B性能 | 港大&字节Seed&复旦
香港大学NLP团队联合字节跳动Seed、复旦大学发布Polaris强化学习训练配方,让4B模型数学推理能力超商业大模型,且Polaris-4B可在消费级显卡部署,相关内容已全部开源。
成本不到8千美元!新浪微博1.5B小模型超越近万亿参数模型
新浪微博开源的VibeThinker - 1.5B模型,仅15亿参数、训练成本不足8000美元,却在顶级数学竞赛基准击败近万亿参数模型。它采用频谱到信号原则,分两阶段训练,性能出色,成本低且数据无污染。
AI能帮忙厨房看火了!面壁智能开源全模态模型MiniCPM-o4.5,边看边听还能主动抢答
面壁智能开源全模态模型MiniCPM-o4.5,能边看边听还主动抢答。它引入全双工多模态实时流机制,在多方向达全模态模型领先水平。该模型是端侧原生,将与开发板配套,助力端侧智能硬件开发。
基于闪电注意力机制,创新高效开源大模型
传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。
从网页截图到精准复刻只需30秒:这个新模型刷新了我的认知
智谱AI发布GLM - 4.6V系列模型,是首个支持工具调用的视觉模型。作者对其进行7个场景测试,如识别鸟类、分析赶海地点等,展现出不错性能。该模型速度快、开源,有优势也有小问题,适合开发者和普通用户。
【万字长文】大模型开源开发全景与趋势解读
本文以蚂蚁开源团队视角,基于OpenDigger数据,分析大模型开源开发生态。呈现2025年全景图,涵盖135项目。指出训练、推理、应用侧主导领域,还探讨生态趋势、项目兴衰及近期厂商动态。
字节会师何恺明!开源连续扩散语言模型Cola DLM
字节会师何恺明,开源连续扩散语言模型Cola DLM,释出论文、代码等。该模型跳出离散token束缚,把生成过程交给连续空间,在实验中展现出稳定scaling趋势,其动机是表征而非diffusion。