大模型私有化」共找到 9161 篇相关文章

产品应用8

0.3B参数,600MB内存!腾讯混元实现产业级2Bit量化,端侧模型小如手机App

腾讯混元团队推出面向消费级硬件的“极小”模型HY-1.8B-2Bit,参数量仅0.3B,内存占用600MB。它基于产业级2Bit端侧量化方案,生成速度提升,还通过多种方法提升能力,未来将探索新技术缩小与全精度模型差距。

量子位
算法论文8

扩散LLM推理新范式:打破生成长度限制,实现动态自适应调节

随着扩散语言模型成为热门,但其推理时存在预设固定长度的限制。香港中文学 MMLab 等提出 DAEDAL,赋予模型根据问题自主调整回答长度的能力,在性能和计算效率上有提升。

机器之心
产品应用8

快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频!

近年来,多模态语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面后训练流程等创新,实现视频理解突破,综合性能领先。

深度学习自然语言处理
新闻资讯7

视远·正心明智——机器之心2025年度AI榜单正式启动

2025年人工智能浪潮奔涌,模型快速迭代,催生新应用形态,中国AI发展精彩。机器之心精心策划2025年度榜单,涵盖最强技术实力企业等多个类别,有意企业可扫码申报。

机器之心
产品应用8

GPT-5.2技术炸场!6核心突破,办公效率拉满

OpenAI凌晨发布GPT-5.2,把专业级AI门槛拉到新高度。它有6核心技术突破,精准戳中职场痛点。在GDPval基准测试中表现出色,有三级模型矩阵,不同版本满足不同需求,各方面能力均有显著提升。

CourseAI
推荐文章8

NVIDIA技术沙龙 《规模EP优化:PD分离MoE并行方式》课程笔记

本文是NVIDIA技术沙龙课程笔记,介绍规模EP优化的PD分离MoE并行方式。涵盖PD分离、规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构性能特点与优化策略,以及各技术工作流程和效果。

GiantPandaLLM
算法论文8

DeepMind 最新研究:智能体就是世界模型

DeepMind研究科学家Jon Richens团队在ICML 2025发表论文,从第一性原理证明智能体就是世界模型,回答了AI界多年的根本问题,还带来多个有趣推论,引发AI社区热烈讨论。

AGI Hunt
开源动态8

重磅开源!首个全异步强化学习训练系统来了,SOTA推理模型RL训练提速2.77倍

清华学和蚂蚁技术研究院联合团队开源全异步强化学习训练系统 AReaL-boba²,坚持“全面开源、极速训练、深度可定制”理念,实现异步 RL 训练,训练速度最高提升 2.77 倍,支持多轮智能体强化学习训练。

机器之心
新闻资讯8

一百万亿Token里的AI现状:OpenRouter和a16z重磅研究带你透视AI江湖

OpenRouter和a16z发布重磅研究,用100万亿Token绘制AI实景地图。2025年推理模型崛起,开源模型流量份额攀升,编程与角色扮演需求,还揭示了用户留存的“灰姑娘效应”等,展现多元AI世界。

AIGC开放社区
产品应用8

告别卡脖子,华为黑科技破局!昇腾推理加速1.6倍打破LLM降智魔咒

模型参数规模,推理部署难。华为诺亚提出Pangu Light框架,结合算法创新与国产昇腾平台,通过跨层注意力剪枝等技术,解决剪枝后模型失稳问题,实现高压缩率、推理加速与高精度。

新智元