「超参数调优」共找到 2664 篇相关文章
4 个月狂飙 22k Star,这本书凭什么?
Github上超火的开源项目《LLMs-from-scratch》中文版4月上市,4个月涨超22k Star。作者实操搭建类GPT - 2模型,涵盖大模型构建全流程。用PyTorch开发,代码少且有注释,对初学者友好,豆瓣评分9.3。
1.5B刷新数学代码SOTA!快手&清华精细化Token管理,LLM推理能力飙升
快手与清华团队用1.5B参数小模型在推理基准上超越同量级SOTA。其Archer方法通过精细化Token管理,对知识型和推理型Token差异化训练,让知识和推理同步更新且互不干扰,在数学和代码任务表现出色。
千问Qwen旗舰预览版Qwen3.6-Max-Preview发布
千问Qwen发布下一代旗舰模型早期预览版Qwen3.6 - Max - Preview,在权威评测中登顶最佳国产模型。此前开源的Qwen3.6 - 35B - A3B用30亿激活参数匹敌数百亿参数稠密模型,新模型在多方面给出技术演进方向。
台积电不相信AI有泡沫
台积电2025年四季度财报多项指标超预期,2026年资本开支大幅上涨。其3nm制程和先进封装优势明显,产能供不应求。AI算力需求爆发让英伟达成新大客户,预计2026年超苹果,台积电未来营收增长可观。
冲上热搜!美团大模型,靠「快」火了
国内外开发者亲测,美团新开源的LongCat - Flash - Chat模型速度超快,推理速度超每秒100个token。它来自美团LongCat - Flash系列,官网可直接用。该模型架构创新,训练方法高效,还做了专属和系统级优化,跑起来又快又便宜。
CVPR 2026 | ReFTA:打破张量化PEFT的「权重重建」瓶颈
随着大模型发展,全参数微调成本高,参数高效微调(PEFT)成主流。常见基于矩阵低秩分解的PEFT方法有局限,张量化PEFT虽有优势但存在权重重建问题。本文提出ReFTA方法解决该问题,有工程和理论优势。
Kimi K2.5登顶开源第一!15T数据训练秘籍公开,杨植麟剧透K3
Kimi K2.5登上Hugging Face热榜榜首,下载超5.3万。它主打Agent能力,成绩超GPT - 5.2等闭源模型,性价比高。官方技术报告公开其用15T数据训练,还搭载Agent Swarm架构,团队还剧透了Kimi K3。
芯片团队规模近3000人!小米扩张自研芯片版图
8月24日小米举行玄戒芯片技术沟通会,公布三颗自研芯片:AI旗舰SoC玄戒O3、端侧AI加速芯片玄戒O100、智驾高算力AI芯片玄戒D100。小米重启大芯片研发五年多,投入超210亿,芯片团队近3000人。
小红书开源大模型dots.llm1,初次出手,小有惊艳!国外网友们又炸了……
小红书hi lab团队公布首个开源大模型dots.llm1,这是142B参数的MoE模型,仅14B激活参数就能与Qwen2.5 - 72B打平。它开源力度大,训练效率高,数据处理精细,训练稳定,获国外网友高度关注。
GPU-MODE Leaderboards之nvfp4_gemv代码阅读
文章围绕GPU-MODE的nvfp4_gemv竞赛rank1代码展开,先介绍问题及官方baseline,后详细解读rank1代码,含数据加载、线程模型等,还剖析核心计算函数,最后总结代码在缓存控制、数据格式等方面的调优亮点。