「超参数调优」共找到 2664 篇相关文章
蚂蚁集团扩散大语言模型新突破:超800Token/s,速度与质量兼得
蚂蚁集团将LLaDA更新到2.1,通过引入“草稿 - 编辑”机制,打破扩散模型推理速度与质量的对立僵局。它有极速和质量两种模式,还采用混合训练流程及强化学习,在多基准测试中表现出色。
Figure机器人直播100小时打擂台,3秒一个不停分拣13万包裹!
Figure公司F.03机器人直播分拣包裹超100小时,分拣超13万个。10小时人机对决中,人类以不到200个包裹险胜。CEO称这是人类最后一次赢,具身智能飞轮或已过拐点。
超 10 万人都在看!Qwen3重塑文本嵌入与重排序技术版图
文本嵌入和重排序是NLP和信息检索关键组件。Qwen3 Embedding、Qwen3 Rerank模型基于Qwen3基础模型构建,有三种参数尺寸。文章介绍其架构、训练方案,还给出实战代码。
OpenAI 开源模型泄露:六大技术细节
OpenAI 可能发布的开源大模型细节泄露,包含两款模型,1200 亿参数 MoE 模型和 200 亿参数稠密模型,专注文本处理。还涉及训练技术、激活函数、上下文窗口、注意力机制及底层架构等方面的技术细节。
如何在24GB显存里,塞下一个万亿参数的巨兽?KTransformers入选顶会SOSP
清华大学与趋境科技联合研发的KTransformers系统,可让消费级显卡跑万亿级参数模型,其论文入选SOSP 2025。该系统解决MoE模型本地部署难题,技术创新多,还与SGLang合作,提升硬件利用率。
腾讯发布超低成本AI训练法!120元效果秒杀70000元微调方案
腾讯提出无训练组相对策略优化Training-Free GRPO,无需调整参数,在提示词中学习经验就能提升模型性能。实验显示,该方法在数学推理和网页搜索任务上效果显著,成本远低于传统方法。
17K star 超火!给你的电脑装上永不遗忘的AI记忆,100%本地运行!
介绍开源项目`screenpipe`,它能7×24小时记录屏幕和音频数据,100%本地运行,保障隐私。对比同类项目Glass,指出两者异同及适用人群,还介绍了安装使用方式。
开启RL Scaling新纪元,siiRL开源:完全分布式强化学习框架,支持超千卡规模高效训练
传统强化学习框架在模型和集群规模达上千块GPU时,存在扩展性瓶颈和效率低下问题。上海创智学院团队推出siiRL,采用全分布式架构和多控制器范式,解决传统框架痛点,在多方面验证了其高性能。
星标超 29 万,OpenClaw 两天两次大更!适配GPT 5.4,告别“抽卡式 Prompt”
GitHub星标超28万的AI Agent开源项目OpenClaw,在周六与周日迎来两轮重量级更新,集中在模型能力、Agent架构、工程部署及安全机制四个方向。2026奇点智能技术大会将邀专家探讨其产业实践价值。
下一代超算,GPU得配QPU:老黄要把量子计算机和GPU「焊」在一起了
在VivaTech 2025会上,黄仁勋发布面向量子计算的革命性平台CUDA - Q。回顾英伟达CUDA - X套件及关键库,强调量子计算“拐点”,描绘QPU与GPU协同蓝图,宣布算法堆栈在Grace Blackwell 200加速。