「小参数模型」共找到 8163 篇相关文章
企业落地 NL2SQL,需要的是 AI-ready data 和 小模型
当NL2SQL从Demo走向生产,关键是‘更干净的数据底座 + 更小的专用模型 + 更可控的工程化流程’。文章指出先数据后模型,小模型足够用且落地成本低,评估要换维度,还介绍了工程化路径等内容。
震惊海外开发者!BOSS直聘3B小模型比肩80B,怎么做到的?
BOSS直聘楠北阁团队发布3B轻量端侧小模型Nanbeige4.1-3B,性能震惊海外开发者。团队从多方面改进,如优化推理和偏好对齐,重构训练数据,采用多种强化学习算法,使其性能比肩大模型。
GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」
大模型推理能力难迁移到小模型,现有强化学习方法如GRPO在小模型上性能提升有限。香港中文大学(深圳)唐晓莹教授团队提出G²RPO - A算法,缓解小模型奖励稀疏问题,在多模型实验中表现优于vanilla GRPO。
小模型代替顶级闭源:微软用4B小助理,砍掉30% Token消耗
微软研究团队提出实用方案,用4B参数的微型模型Terminus - 4B替换昂贵顶配大模型接管终端执行任务,采用SFT和RL策略打造子智能体,经测试效果良好,节省Token消耗。
不堆参数堆架构,这个8B开源模型把图像理解和生成统一了
商汤开源全新架构的理解生成统一模型SenseNova-U1,虽小尺寸版仅8B参数,却能复刻GPT - Image - 2的不少绝活,在多项指标上登顶开源模型榜首,推理速度逼近主流商用闭源模型。它具备连续性图文创作等能力,底层是NEO - unify架构。
蚂蚁抛弃向量推荐!用8B小模型构建「用户“话”像」,实现跨模型通用并拿下SOTA
2026年AI开发者关注爆款大模型应用,个性化是关键。蚂蚁集团和东北大学团队推出AlignXplore+,实现文本化用户建模新范式,有全域通用、极致迁移、实战适配特性,小参数超越基线,未来将继续探索。
jina-embeddings-v5-omni 发布!全模态向量小模型
Jina AI发布`jina-embeddings-v5-omni`,将`v5-text`能力拓展到多模态。`v5-omni-small`参数量小却追平LCO - 7B,在多模态评测中表现优异,但视频是短板。其采用‘冻结 + 投影’架构,训练快、省显存。
最新发现!每参数3.6比特,语言模型最多能记住这么多
Meta、DeepMind等团队研究语言模型记忆容量,提出新方法估计模型对数据点的‘了解’程度,发现GPT系列模型约每个参数3.6比特,还提出模型容量等相关定律,激发社区多方面思考。
腾讯混元开源 4 个小尺寸模型,主打 Agent 和长文
8月4日腾讯混元开源四款小尺寸模型,参数为0.5B、1.8B、4B、7B,消费级显卡可运行。模型推理快、性价比高,在多领域表现出色,亮点是Agent和长文能力,已在腾讯多业务应用。
Qwen3-VL-Seg 深度解读:当多模态大模型学会"像素级精准手术",仅用0.4%参数碾压8B模型
文章深度解读阿里通义实验室发布的Qwen3-VL-Seg,它解决开放世界指代分割问题,用仅17M参数(占基础模型0.4%)在4B规模超越8B模型。介绍其原理、架构、数据、实验结果,还给出实战代码。