智能体训练」共找到 5164 篇相关文章

产品应用8

1人顶1个Infra团队!OpenAI前CTO新招,让大模型训练跌成白菜价

大模型训练正从‘作坊炼丹’进化为‘工业微调’。OpenAI前CTO创立的Thinking Machines Lab推出Tinker,潞晨云微调SDK兼容其范式,实现算法设计与基础设施解耦,降低成本,提升人效,适用于多场景。

新智元
算法论文8

调整训练数据出场顺序,大模型就能变聪明!无需扩大模型/数据规模

微软亚洲研究院提出全新文本数据组织范式DELT,通过引入数据排序策略,充分挖掘训练数据潜力,优化训练数据的组织方式,在不同模型尺寸与规模下都达到了良好性能,且不用增加数据量或扩大模型规模。

量子位
算法论文8

想清楚再动手:具身智能也要学会脑补未来和择优执行 | RSS 2025

近年来基础模型在具身智能领域能力惊人,但在真实部署中常‘用不好’。卡耐基梅隆大学与伯克利人工智能研究院团队提出 FOREWARN 框架,结合‘世界模型’与‘多模态语言推理’,解决部署智能难题。

机器之心
推荐文章7

新手必看!强化学习入门指南 | 从RLHF、PPO、GRPO到RLVR,最后到训练推理模型

Unsloth团队发布强化学习教程,从吃豆人谈起,介绍RLHF、PPO、GRPO等概念,分享用GRPO训练推理模型技巧。涵盖强化学习基础知识,还给出Unsloth使用GRPO训练模型方法及奖励函数示例。

AINLPer
产品应用7

一家智能眼镜公司,为什么非要自研AI大模型系统?|甲子光年

智能眼镜要么不够智能,要么不像眼镜,李未可科技CEO茹忆认为AI要成第一响应者。该公司推三款AI眼镜,搭载自研系统。其自研AI大模型系统,是为交付难复制AI验闭环,解决通用API不足等问题。

甲子光年
新闻资讯8

Agent重塑软件与互联网产业新范式,2026奇点智能技术大会初版日程出炉!

4月17 - 18日,CSDN与奇点智能研究院联合举办的「2026奇点智能技术大会」将在上海举行。大会云集顶尖机构与企业一线AI实践者,围绕前沿议题分享,还将首发《AI原生软件研发成熟度模型(AISMM)》白皮书。

AI科技大本营
算法论文8

传统训练效率很低?我们靠 “给模型降噪” 重新审视长上下文建模难题

文章指出长上下文模型处理长文本时易受噪声干扰,提出新评估指标IG分数和“上下文去噪训练(CDT)”方法。实验表明CDT优于现有策略,经其训练的开源模型在长上下文任务中性能媲美GPT - 4o。

深度学习自然语言处理
新闻资讯7

龙虾社交上线40天被Facebook收购!俩文科创始人加入超级智能实验室

刚上线40天的AI Agent社交网站Moltbook被Meta收购,两位文科创始人将加入Meta超级智能实验室。Moltbook因人类冒充AI的假帖子爆火,但安全漏洞明显。Meta看中其让AI智能在线连接的能力,或优先修复安全问题。

量子位
开源动态8

「上下文学习」之后,腾讯混元第二篇公开研究:精准定位RLVR训练崩溃的“罪魁祸首”Token

腾讯混元团队新研究提出异常梯度定位器 GradLoc,可将全局梯度突刺定位到具异常 token,降低 RLVR 训练观测与分析门槛,助力解决训练不稳定问题,让模型调优更科学。

机器之心
算法论文8

训练成本暴降99%,35秒出1分钟高清视频!英伟达MIT等引爆视频AI革命

英伟达联合MIT、港大团队提出SANA - Video架构,其核心是创新的全局线性注意力Diffusion Transformer训练框架和全局显存恒定的KV缓存机制。它训练成本低、速度快、可部署,重新定义AI视频生成效率极限。

新智元