大模型部署」共找到 9473 篇相关文章

开源动态7

从“开放模型”到“开放生态”,AI 开源进入下半场

近期,Meta 推出开放权重模型,而开放模型商业使用收费渐成趋势。AI 开源面临成本、边界等问题,竞争从模型能力转向基础设施选择。世界人工智能开源赛关注模型应用,凸显开源生态建设重要性。

AI前线
开源动态8

Hugging Face 推出 GOLD:让不同模型家族也能做知识蒸馏

Hugging Face研究团队提出GOLD方法,解决了知识蒸馏中老师和学生模型需用同一套分词器的痛点,让不同模型家族间也能做知识蒸馏。它通过三步解决跨分词器蒸馏,实验效果良好,已集成到TRL库。

AI工程化
新闻资讯7

Gartner发布生成式AI模型提供商魔力象限

Gartner发布《生成式AI模型提供商创新指南》,首次对生成式AI市场进行象限划分,按功能完整性和未来潜力将厂商分为新兴领导者、新兴挑战者、新兴远见者和新兴专家四个区域,还指出AI正从实验转向企业核心层。

AI工程化
算法论文8

首个用户生活「长程模拟器」来了!LifeSim 重新定义模型个性化评测

现有个性化助手评测基准与真实用户-助手交互脱节,来自复旦学等的研究人员提出 LifeSim 框架及 LifeSim-Eval 评测方法。实验显示主流 LLM 处理显性需求尚可,隐性意图识别等方面短板明显。

机器之心
开源动态7

VeRL-Omni:面向扩散和全模态生成模型的通用RL后训练框架

VeRL-Omni是面向多模态生成模型的通用RL后训练框架,覆盖多种架构。它有高效多模态rollout、灵活奖励引擎等特性,支持多种硬件,团队还验证了不同训练方式,后续将扩展模型与算法支持。

机器之心
开源动态7

DeepSeek 新模型 R1-0528 悄悄开源,与o3 相当,实测来了。

DeepSeek团队悄无声息地在Hugging Face上开源推理模型新升级版DeepSeek R1-0528,基于DeepSeek-V3-0324模型,架构和训练方法有改进,性能与o3相当,实测表现不错。

AI进修生
新闻资讯7

The Batch: 871 | Mistral测量了语言模型的能耗、水耗与物料消耗

法国AI公司Mistral发布对Mistral Large 2的环境分析报告,涵盖全生命周期影响。研究表明单次使用影响小,但累计负担。虽研究有不足,但其方法或推动环保型AI发展。

DeeplearningAI
算法论文8

除了prompting外,不动参数,如何改变模型行为?

文章指出传统提示工程控制模型生成行为有缺陷,提出Steering Target Atoms (STA)方法。它用稀疏自编码器分解LLM高维表示,定位“原子知识组件”精准控行为,实验效果超现有技术,还能控制推理长度。

深度学习自然语言处理
开源动态8

纯血国产!4B模型越级打怪,杀入万亿赛道

9月1日,Hugging Face上线星火X2.5-4B和1.7B开源端侧模型,在多指标测试中表现优异,实现“越级打怪”。该模型基于全国产算力平台训练,在断网笔记本上实测效果惊艳,使用了两项技术提升能力,适配性强。

新智元
开源动态7

闲置手机装OpenClaw:三个不走寻常路的OpenClaw端侧部署项目

文章介绍了三个不走寻常路的OpenClaw端侧部署项目,如在25美元手机、5美元芯片运行OpenClaw,还有安卓手机变AI主机。展示新思路,也指出端侧部署有局限,云+端协同才是最佳。

AI工程化