「超参数调优」共找到 2664 篇相关文章
14B规模竟也能单卡实时生成视频?多亏这个强大的开源底座
春节期间 Seedance 2.0 爆火,字节跳动等开源视频模型 Helios 家族,参数量 14B,单卡生成速度达 19.5 FPS。它与 UniWorld-OSP2.0 技术栈同源,后者是超百亿级视频生成大模型,有诸多技术突破。
Meta提出Deep Think with Confidence:几乎啥都不用动,就能提升推理的准确性与效率
传统自一致性方法虽能提升推理准确率,但计算开销大、收益递减。Meta AI与UCSD团队提出Deep Think with Confidence(DeepConf),可在不增训练成本和不调超参数下,提升推理准确性与效率,本文对其全面解读。
北大团队提出 SHINE:将任意文本转化为大模型 LoRA,仅需一次前向传播!
北大团队提出全新超网络架构 SHINE,仅需一次前向传播就能将任意文本转化为大模型 LoRA 参数,支持多轮对话。该方法实用潜力大、架构创新高效,训练流程成熟,推理快速,为大模型持续学习提供新思路。
这可能是,全球最强开源Agent模型,走了一条反Scaling Law的全新范式!
MiroThinker v1.5开源,其30B小模型在Agent benchmark上击败万亿参数的Kimi K2T。它以交互深度为新Scaling维度,训练有严格时间管控,实测表现超Search Agent,“小模型+强交互”或成新方向。
Thinking Machines又发高质量博客:力推LoRA,不输全量微调
Thinking Machines 博客力推 LoRA 并与全量微调对比。研究发现小数据量任务中 LoRA 与全量微调效果接近,大数据量稍吃力,强化学习中低秩 LoRA 也能接近全量微调。还揭示了 LoRA 关键要素、超参数规律等。
NVIDIA技术沙龙《强化学习流水线优化:性能分析与 Rollout加速》演讲笔记
该演讲笔记围绕强化学习流水线优化,强调用Nsight Systems做性能分析,介绍在Ray Actor添加参数及解读文件方法。给出训练/生成参数优化技巧,如Actor训练和Rollout优化,还以Qwen 2.5 7B等模型为例总结参数调优经验。
人均「95后」,账上超十亿美金,MiniMax叩响港股大门
国内AI创业公司MiniMax在港交所刊发招股书,上市进入冲刺阶段。它以全模态技术和产品服务全球用户,营收增长快、亏损收窄,M2模型表现亮眼,且团队年轻高效,此次上市意义非凡。
核心AI场景首超英伟达,一场国产算力的“破局叙事”|甲子光年
1月26日,天数智芯公布四代架构路线图,其2025年的天数天枢架构,在DeepSeek V3场景实测性能领先英伟达Hopper约20%。该企业以技术创新、解决行业痛点等构建新范式,产品全场景布局且已规模化落地。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
3 亿美元 ARR、估值超 20 亿美元,演语科技是怎么做 ToC 应用增长的?
AI应用难做,演语科技却完成近3亿美元B+轮融资,估值超20亿美元,ARR超3亿美元。其成功在于找准付费人群、做厚应用、激进增长,让产品功能转化为收入,为AI应用商业化提供范例。