多步聚合训练」共找到 5661 篇相关文章

开源动态8

ROCK & ROLL!阿里给智能体造了个实战演练场 | 开源

阿里开源新项目ROCK,解决了智能体无法在真实环境中规模化训练的难题。它与阿里此前的RL训练框架ROLL配合,构成完整的智能体训练闭环,推开了Agentic AI规模化应用的大门。

量子位
算法论文8

RL是「点金石」还是「挖掘机」?CMU 用可控实验给出答案

卡耐基梅隆大学研究者构建基于GSM - Infinite的可控合成数据框架,分析预训练、中期训练和RL对模型推理泛化能力的影响,调和了RL有效性的不同观点,为改进训练策略提供基础。

机器之心
开源动态8

GitHub 狂揽 12K Star!把 OpenClaw 以及所有 Code Agent 工具装进一个界面!

AionUi是本地优先、开源免费的AI Cowork平台,将散落终端的命令行AI工具统一到图形界面。它兼容主流工具,有统一平台、工具支持等特点,还具备任务并行等核心能力,适合Code Agent用户。

开源星探
推荐文章7

LLM学习笔记:最好的学习方法是带着问题去寻找答案

文章总结拓展Andrej Karpathy教学视频,分析大模型聊天流程与原理,介绍LLM训练步骤,包括预训练、后训练和强化学习,还提及主流特性应用,如文件上传、网络搜索,强调带问题学习的重要性。

腾讯技术工程
算法论文7

刚刚,OpenAI发长篇论文:大模型幻觉的原因找到了~

OpenAI发论文揭示语言模型出现幻觉的根本原因,即训练和评估过程奖励猜测而非承认不确定性。预训练阶段就埋下幻觉种子,后训练阶段‘考试机制’强化幻觉,还给出改评分规则的解法。

PaperAgent
开源动态7

支持持久化知识图谱!Agent协同的革命性框架

Agent - MCP 是为经验丰富的 AI 开发者设计的 Agent 协同框架,能解决传统 AI 开发难题。亮点有并行开发、持久化知识图谱和实时可视化协作,可让 Agent 高效协作,避免上下文丢失和任务冲突。

GitHubStore
新闻资讯8

小米罗福莉:MiMo-V2.5如何做到又快又强又便宜? | ICML 2026

2026年7月ICML大会上,小米MiMo团队负责人罗福莉介绍MiMo - V2.5系列。该系列跳出传统思路,从架构、训练、推理协同设计,实现“聪明、快速、便宜”,如预训练降成本、后训练有硬核算法、推理加速达1000 TPS。

AI科技评论
算法论文8

SFT在帮倒忙?新研究:直接进行强化学习,模型模态推理上限更高

学界常用「监督微调(SFT)+ 强化学习(RL)」训练大模型。但新研究发现,SFT 会引发「伪推理路径」,阻碍推理进步。相比之下,直接进行 RL 训练,模型模态推理上限更高,该团队训练的模型还刷新了纪录。

机器之心
产品应用7

Hexstrike AI在个工具及模型上的渗透测试表现

文章围绕Hexstrike AI在个工具及模型上的渗透测试展开。介绍测试环境,用不同难度靶机测试。分析Claude desktop+Sonnet 4.5、AIaW+Deepseek、Cursor+个模型等组合表现,指出LLM辅助渗透测试任重道远。

AI与安全
算法论文8

ICLR 2026 | CineTrans: 首个转场可控的镜头视频生成模型,打破闭源技术壁垒

随着视频生成模型发展,影视级长视频需镜头序列及自然转场,这成新挑战。上海人工智能实验室团队提出 CineTrans 模型,基于掩码机制实现自动化转场,还构建 Cine250K 数据集,实验效果超基线。

机器之心