「大模型技术」共找到 10342 篇相关文章
马斯克悄然发布Grok 4.1,霸榜大模型竞技场所有排行榜
马斯克发布Grok 4.1,同时霸榜大模型竞技场第一和第二。它在思考与非思考模式表现出色,还在新专家榜和职业榜霸榜。此外,它在情商测试表现佳,还加强快速回复、改善幻觉问题,已向所有用户开放。
Meta最新大模型RL微调:在线DPO/GRPO显著优于离线DPO
Meta和NYU研究强化学习在大模型微调中的有效性,对比离线、半在线和在线训练范式。半在线和在线显著优于离线,多任务结合可验证与不可验证任务能提升性能,还给出不同任务的测试数据。
国产MiroMind智能体框架,登顶全球预测未来大模型榜单
国产MiroMind公司在全球首个动态实时预测基准FutureX上夺冠,老板是陈天桥。其开源的MiroFlow v0.2智能体框架优势明显,能升级大模型能力,且成本低、可复现。MiroMind在预测赛道领先。
英伟达再出手!新型混合架构模型问世,两大创新实现53.6倍吞吐提速
英伟达研究者提出新混合架构语言模型 Jet - Nemotron,在达 SOTA 全注意力模型精度时效率卓越,2B 版性能超 Qwen3 等,H100 GPU 上生成吞吐量最高加速 53.6 倍,基于 PostNAS 和 JetBlock 两大创新。
官宣!前 OpenAI 华人科学家姚顺雨加入腾讯,大模型“系统战”开启!
12月17日消息,前OpenAI科学家姚顺雨加盟腾讯,任首席AI科学家等职。他是AI Agent与大模型推理领军人物,其加入是腾讯AI补强。腾讯还新成立三部门,标志战略向系统化工程建设进阶,混元也有不错表现。
打破视觉Token的算力诅咒,RedundancyLens如何为多模态大模型推理减负
多模态大模型的 Decoder - only 架构处理视觉 Token 有计算冗余。合合信息团队提出无需额外训练的动态计算削减方法,在不影响性能前提下降低推理成本,适用于多场景。
小红书提出社交大模型RedOne 2.0:兼听、敏行
在SNS内容爆炸式增长的当下,传统SFT训练方法有局限。小红书NLP团队推出RedOne 2.0社交大模型,采用以RL为核心的三阶段渐进式训练方法,实验显示其性能优异,还能转化商业价值。
告别Transformer,重塑机器学习范式:上海交大首个「类人脑」大模型诞生
上海交通大学团队发布首个「类人脑」大模型 BriLLM,脱离传统 Transformer 架构限制。它基于 SiFu 学习机制,有可解释性、能无限处理上下文等优势,还支持多模态融合,已获交大重点项目资助。
一种基于滑动层合并的高效深度修剪大模型的方法
文章指出深度修剪可加快推理速度,但直接丢层会降低性能。为此提出滑动层合并法,根据相似度阈值融合连续层,简化结构且保持性能。实验显示该方法优于现有技术,还揭示了与宽度修剪结合的潜力。
LLM 技术在有道词典笔上的应用实践
本文围绕LLM技术在有道词典笔的应用展开。先分析端侧大模型落地挑战,如算力、功耗等。介绍有道词典笔等硬件及应用,对比端侧与云侧AI优劣。还阐述模型落地模式、算法优化及“子曰3数学模型”开源情况。