「大语言模型(LLM)」共找到 8170 篇相关文章
RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力
多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。
大模型七连发,外国人馋透了!阿里云栖大会全栈升级够狠
阿里在2025云栖大会全栈升级,发布七款通义新模型,从基础大模型到各专项领域全覆盖。旗舰模型Qwen3 - Max性能超GPT - 5等,新架构Qwen3 - Next实现效率突破,多模型开源且表现出色。
模型合体!上交&上海AI Lab&华师提出LED-Merging,拒绝「能力」与「安全」二选一
上海人工智能实验室等团队提出LED - Merging解决模型融合“安全 - 效用冲突”问题。该方法无需训练,像“神经元手术刀”,不牺牲专业能力还提升安全性,论文已被ACL 2025 Main Conference接收。
AST| 西工大单湘淋、张伟伟等:基于湍流各向异性分析与符号回归的改进型二阶非线性涡粘模型
针对非线性涡粘模型各向异性建模难题,西工大单湘淋、张伟伟等通过雷诺应力各向异性分析方法开展特征提取,构建新型二阶非线性涡粘模型,在方形管道与矩形扩压器湍流测试中,精度优于现有模型。
里程碑!逻辑智能发布全球首个完全开源语音大模型框架LLaSO,语音AI迎来新纪元
逻辑智能发布全球首个完全开源语音大模型框架LLaSO,它像“全家桶”,提供高质量数据、统一评测基准和强大基础模型。语音大模型发展遇瓶颈,LLaSO框架及参考模型LLaSO - Base有望打破僵局。
顶尖技术+标准产品+创新模式+可靠服务,打造大模型商业落地中国范式 | 卓世科技@MEET2026
在大模型参数竞赛白热化的当下,焦点转向模型如何在行业存活、产生价值。卓世科技合伙人赵策在MEET2026大会提出,大模型下一场竞争在模型、终端、数据与业务流闭环,该司据此在多领域落地应用。
给非技术人的大模型介绍:从零训练ChatGPT的全流程、天价成本及企业务实替代方案
文章介绍从零训练ChatGPT级别大模型的全流程、高昂成本,指出这对多数企业不现实。建议企业战略从构建转向应用,通过租用API或微调开源模型利用大模型,将专有数据视为核心资产。
中移动九天团队MultiPL-MoE:全新Hybrid-MoE架构用于增强通用大模型低资源代码能力
大语言模型在有限计算资源下提升多语言代码能力面临挑战。中国移动九天团队提出 Hybrid MoE 架构 MultiPL - MoE,耦合两层专家选择机制优化,实验证明其在增强低资源代码能力、缓解高资源语言遗忘上有效。
Qwen-Scope:看穿大模型的“小心思”
Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。
仅保留35% Token,性能反超原模型!快手可灵等用视觉信息引导音频压缩,推理时间直降42%
Omni - LLM计算浪费严重,快手可灵等团队提出OmniSIFT框架。它利用音视频非对称依赖关系,通过时空联合剪枝压缩视频、视觉引导筛选音频Token,大幅减少Token数量,提升性能和推理效率。