「优化方法」共找到 2567 篇相关文章
14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1
如今的大语言模型推理能力关键在于测试时扩展,但长思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。
刚刚,英伟达新模型上线!4B推理狂飙53倍,全新注意力架构超越Mamba 2
Jet - Nemotron是英伟达推出的小模型系列(2B/4B),由全华人团队打造。其提出PostNAS与JetBlock,实现架构优化。相比Qwen3等模型,它在多维度准确率更高,H100 GPU上推理吞吐量最高提升53倍。
AI安全上,开源仍胜闭源,Meta、UCB防御LLM提示词注入攻击
Meta和UCB开源安全大语言模型Meta - SecAlign - 70B,其对提示词注入攻击鲁棒性超闭源方案,还具更好的agentic ability。介绍了提示词注入攻击背景、防御方法,该模型打破闭源垄断,开源代码助力安全AI建设。
【博客转载】CUDA Reduction
文章来自Lei Mao,介绍CUDA归约操作。先阐述归约操作在并行计算中的常见性,接着实现两个批量归约求和kernel,还给出构建和运行示例的命令及结果。最后探讨大数组归约求和的方法及性能影响。
员工每天花1000美元也要用ClaudeCode!创始人:太贵了,大公司专属,但它比 Cursor 猛!
Claude Code处理大型代码库能力强,但价格贵,有用户称能力超Cursor。其创始人分享设计理念、使用方法等,还提到它基于Claude 4系列模型有新变化,可在GitHub等场景用,未来会拓展工具协同和小任务处理。
不是视频模型“学习”慢,而是LLM走捷径|18万引大牛Sergey Levine
UC伯克利大学副教授Sergey Levine提出,为何语言模型从预测下一词中学到很多,视频模型从预测下一帧却学得少。他指出LLM可“抄近路”模仿人类推理,像在“柏拉图洞穴”中,还探讨了AI走出困境的方法。
别只做skill了,都去做插件吧
Claude Code的插件系统上线,解决了配置难分享、版本化和审核的问题。它将已有能力标准化,介绍了插件与独立配置选择、上手步骤、可装内容、测试方法、提交市场及从独立配置迁移等内容,还提及其他软件推插件市场。
精打细算虾养成指南: 省 Token 和把 AI 用好,从来就是一件事
文章指出用AI时Token成本高、模型变笨,原因是上下文管理不善。介绍了省Token和用好AI的方法,如按需取上下文、明确约束、多智能体协作、按阶段切换模型等,核心是在合适时间将合适上下文装入合适模型。
智谱开启狂飙模式!7倍提速,全球最快,旗舰模型即问即答
5月22日,智谱上线GLM - 5.1高速版API,输出速度达400 tokens/s,刷新全球大模型API速度纪录,比原版提速约7倍。该速度由GLM团队和TileRT团队联合打造,核心优化分三层推进,且是稳定可用的生产级能力。
名师一定出高徒?清华团队最新揭秘:别再迷信大模型蒸馏的「免费午餐」
当下大模型后训练中,On-Policy Distillation(OPD)成明星技术,业界采用后报告性能提升。但清华团队研究发现,换更强Teacher,Student性能可能无提升甚至倒退。研究揭示蒸馏成败条件,深挖对齐机制,还给出拯救失败蒸馏的方法。