显著性方法」共找到 1251 篇相关文章

开源动态8

专为“超大模型而生”,新一代训练引擎 XTuner V1 开源!

9月8日,上海AI实验室开源书生大模型新一代训练引擎XTuner V1。它能应对复杂训练场景、速度更快,尤其在超大规模稀疏混合专家(MoE)模型训练中优势显著。还将一并开源AIOps工具DeepTrace与ClusterX。

OpenMMLab
算法论文7

斯坦福:优化器「诸神之战」?AdamW 凭「稳定」胜出

斯坦福大学 Percy Liang 团队研究指出,虽有不少声称能显著加速的优化器替代案,AdamW 仍为预训练稳健首选,但矩阵型法在特定数据–模型比例下优势明显。研究还揭示了现有研究的法论缺陷。

机器之心
算法论文8

Think in Games:做一个在王者荣耀中会玩和思考的Agent

文章介绍论文《Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models》,指出当前AI在游戏领域面临的困境,提出TiG框架结合大语言模型与强化学习,打造既会做又会说的AI,实验验证其高效

深度学习自然语言处理
算法论文8

让AI作画自己纠错!随机丢模块就能提升生成质量,告别塑料感废片

来自清华、阿里等的团队推出S² - Guidance法,通过随机丢弃网络模块动态构建子网络实现自我修正。它避免了其他法繁琐调参,在文生图和文生视频任务中显著提升生成质量与连贯,且计算高效。

量子位
算法论文8

字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限

强化学习虽提升大语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在多数学推理基准实验中显著优于强基线,为大模型强化学习提供新范式。

量子位
推荐文章7

当博世XC决定像创业公司一样去战斗

本文讲述博世智能驾控事业部(XC)变革故事。2022 年交付遇阻,李金龙小范围改革;2023 年订单减少,吴永桥上任展开变革。博世加大中国业务变革,像创业公司战斗,订单增长,未来左右开弓应对竞争。

芯师爷
算法论文8

普林斯顿等高校提出AgentDistill:无需任何训练即可继承大Agent复杂能力,能提升48%,成本降低90%

在AI领域,大型语言模型智能体计算需求大限制部署,传统蒸馏技术对智能体效果有限。AgentDistill提出解决案,让学生智能体复用教师智能体的MCP工具包,无需训练继承复杂能力,小模型显著提升。

深度学习自然语言处理
推荐文章7

本地LLM万字救场指南来了!全网超全AI实测:4卡狂飙70B大模型

文章围绕本地大语言模型(LLM)展开,针对实用和经济问题,用Dell Precision 7960塔式工作站对主流模型测试。涉及不同尺寸模型、推理框架等,给出不同配置下能指标及使用建议,还模拟真实场景测试。

新智元
新闻资讯7

差点被Ilya摁掉,胎死腹中!ChatGPT爆红内幕首次公开

本文深度揭秘ChatGPT爆红内幕,从产品发布、命名内幕到团队文化等面展开。还提及OpenAI内部对发布的争议,以及ChatGPT发布式的转变,同时指出依赖用户反馈改进模型存在的问题和OpenAI看重的人才特质。

新智元
产品应用8

抢先OpenAI?AIUI全新升级燃爆22亿终端,国内大厂定义智能交互

科大讯飞围绕智能交互场景,对AIUI、机器人超脑等4大平台全面升级。其AIUI以大模型为引擎,有儿童专属交互案,还推出智能眼镜“三麦阵列”等,各平台在多领域应用成果显著

新智元