小尺寸模型」共找到 8092 篇相关文章

算法论文8

Thinking Machine新研究刷屏!结合RL+微调优势,模型训练更具性价比了

Thinking Machine新研究提出On - Policy Distillation方法,结合RL与微调优势。该方法让学生模型每步由教师模型指导,用KL散度评估分歧。实验表明其训练模型性价比高,还能解决AI“灾难性遗忘”问题。

量子位
算法论文8

模型大作为!微博的VibeThinker-1.5B超越DeepSeek R1等头部大模型

近年来,“参数越大,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发的VibeThinker - 1.5B用1.5亿参数和低训练成本,在多项测试中超越头部大模型,还提出SSP框架和MGPO算法。

深度学习自然语言处理
开源动态8

蚂蚁抛弃向量推荐!用8B模型构建「用户“话”像」,实现跨模型通用并拿下SOTA

2026年AI开发者关注爆款大模型应用,个性化是关键。蚂蚁集团和东北大学团队推出AlignXplore+,实现文本化用户建模新范式,有全域通用、极致迁移、实战适配特性,参数超越基线,未来将继续探索。

量子位
开源动态8

9B“模型干了票“大”的:性能超8倍参数模型,拿下23项SOTA | 智谱开源

智谱发布并开源仅9B大模型GLM-4.1V-9B-Thinking,在28项评测中拿下23个SOTA,成10B级别最佳VLM模型。它引入思维链推理机制,通过课程采样强化学习提升能力,还获10亿投资。

量子位
新闻资讯8

同一天两件大事!模型直接掀翻千亿参数,走向效率为王

5月13日AI圈有两件大事,何恺明团队发布语言模型ELF,面壁智能开源MiniCPM-V 4.6。二者显示AI正从‘堆算力’转向‘省算力’,拉开AI轻量化浪潮序幕,未来模型或成关注方向。

AI科技评论
开源动态7

模型也能精确计算:WorldModel-Qwen的推理时代码执行实验

开发者bigattichouse让Qwen - 0.6B模型推理时生成并执行WASM代码获计算结果。最初尝试加标签生成Python代码效率低,后用WASM,创建三层架构。虽结果未完美,但接近,还通过Gemini审查验证。

AI工程化
算法论文8

10个模型并联跑赢GPT-4.1!无额外训练,方法仅4步

上海人工智能实验室等机构提出Avengers框架,无需额外训练,通过四步集结模型优势。实验表明,其在15个数据集上平均得分超GPT - 4.1,还探究了框架有效的要素,对AI研究和开源社区意义重大。

量子位
算法论文8

Loop-ViT:让AI学会「反复思考」,3.8M参数模型追平人类平均水平

香港科技大学等团队提出 Loop - ViT,将循环 Transformer 引入视觉推理领域。该模型参数少但性能强,3.8M 版本追平人类平均水平,揭示视觉推理任务中‘思考时间’比‘模型’更重要。

机器之心
新闻资讯8

微软刚发布Mu模型:支持Windows智能体,参数跑出10倍性能

今天凌晨微软发布创新参数模型Mu,3.3亿参数性能比肩Phi - 3.5 - mini,体量10倍,离线NPU笔记本每秒超100 tokens响应。它支持Windows智能体,架构有多项创新,经训练优化后智能体表现出色。

AIGC开放社区
7

Meta新模型逼平Fable 5,扎:开源且便宜到你懒得算账

Meta推出新模型Muse Spark 1.3,在Artificial Analysis榜单中与Fable 5打平手。扎称其在Coding和Agent工作有大幅提升,还便宜。网友实测它真能肝、真能省,Meta团队核心研究员也透露背后改动。

量子位