中训练」共找到 4185 篇相关文章

算法论文8

普林斯顿等高校提出AgentDistill:无需任何训练即可继承大Agent复杂能力,性能提升48%,成本降低90%

在AI领域,大型语言模型智能体计算需求大限制部署,传统蒸馏技术对智能体效果有限。AgentDistill提出解决方案,让学生智能体复用教师智能体的MCP工具包,无需训练继承复杂能力,小模型性能显著提升。

深度学习自然语言处理
开源动态8

完全开源的7B模型,性能比肩主流LLM,训练成本仅16万美元,复现DeepSeek的强化学习!

Moxin-7B由多机构团队联合开发,遵循“开源科学”原则,公开全流程细节。它训练成本仅16万美元,评测表现亮眼,在架构、数据策略、训练过程等方面有创新,为小企业提供可控AI方案。

AI科技大本营
产品应用8

还得是华为!Pangu Ultra MoE架构:不用GPU,你也可以这样训练准万亿MoE大模型

华为盘古团队发布Pangu Ultra MoE模型架构与训练方法的文技术报告。该模型全流程在昇腾NPU上训练,团队在架构和训练方法创新,实现准万亿MoE模型训练,还在多方面优化提升性能。

机器之心
算法论文8

奖励模型预训练新范式POLAR:突破强化学习短板,有望打通RL链路扩展“最后一环”

强化学习奖励模型设计与训练是瓶颈,上海人工智能实验室提出奖励建模新范式POLAR。它摆脱传统“绝对偏好”限制,契合强化微调框架,通过对比学习训练,实验证明其性能和泛化性佳,有望打通RL链路扩展最后一环。

OpenMMLab
开源动态8

搜索智能体RAG落地不佳?UIUC开源s3,仅需2.4k样本,训练快效果好

当前 Agentic RAG 落地有挑战,UIUC 和 Amazon 提出 s3 训练范式。它仅需 2.4k 样本,训练快且效果好,解决了优化目标偏离、检索与生成耦合等问题,在通用和医学 QA 任务表现出色。

机器之心
算法论文8

MSRA清北推出强化预训练!取代传统自监督,14B模型媲美32B

微软亚洲研究院联合清北提出全新预训练范式RPT,将强化学习融入预训练,把预训练语料库重构为推理问题集。实验显示RPT-14B表现出色,在多方面媲美甚至超越32B模型,未来RL或在LLM预训练掀起风暴。

量子位
算法论文8

抗干扰能力提升近40% !无需对抗训练,北航上海AI Lab新蒸馏方法提升模型鲁棒性 | ICML 2025

在人工智能模型规模持续扩大的今天,数据集蒸馏方法能提升训练效率、降低成本,但蒸馏模型在安全性要求高的任务抗干扰难。北航上海AI Lab团队提出ROME方法,无需对抗训练,显著提升模型鲁棒性,成果被ICML 2025接收且已开源。

量子位
新闻资讯7

突发!OpenAI停止强化学习训练两周

OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。

机器之心
推荐文章8

让AI变成Super员工的秘密:高效训练Skills

文章复盘打造 web - testing Skill 的 4 个翻车教训,分享工程化训练心法。指出训练 Skill 能让 AI 在业务里更可靠,将通用模型变成懂业务、会自检、能稳定交付的员工,还给出训练方法。

腾讯技术工程
新闻资讯8

英伟达:RLP 让 AI 在预训练时就学会思考

英伟达研究团队发布 RLP 技术,与传统大语言模型训练不同,它在预训练阶段就让模型学会'先想后说'。通过奖励机制自我监督,实验效果惊人,性能提升显著,不挑数据,打破了大模型训练范式。

AI工程化