多阶段强化学习」共找到 2106 篇相关文章

推荐文章8

Anthropic 发布 AI Native 全流程实践指南

Anthropic应用AI团队发布实践指南,阐述如何将AI融入软件开发生命周期各环节。指出代码不再是瓶颈,构建快但周边流程慢。指南围绕六阶段展开,给出实施步骤、治理框架和度量指标。

AGI Hunt
开源动态8

文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”

港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。

量子位
推荐文章7

为什么我觉得AGI并不会马上到来

作者Dwarkesh Patel认为AGI不会马上到来。当前大语言模型缺乏持续学习能力,难以替代人类工作;计算机操作能力受训练周期、数据等限制;推理能力虽有突破,但仍需时间发展。作者给出了具体预测时间。

宝玉AI
新闻资讯7

科学界论文高引第一人易主!AI站上历史巅峰

深度学习三巨头之一Yoshua Bengio成各领域被引最多在世科学家。其多篇论文为深度学习奠基,影响自然语言处理等研究。他近期再创业,还介绍了论文引用排名情况,凸显AI和医学热度。

量子位
新闻资讯8

新鲜出炉!斯坦福2025 CS336课程全公开:从零开始搓大模型

斯坦福大学2025年春季CS336课程“从头开始创造语言模型”课程和材料全公开。介绍了讲师信息,课程目标是引导学生开发语言模型,含5单元19门课,注重实践,还说明了学习该课程需具备的能力。

机器之心
算法论文8

OpenVision 2:大道至简的生成式预训练视觉编码器

多模态大模型浪潮中,视觉模块是关键。此前OpenVision训练管线复杂,成本高。研究者提出OpenVision 2,移除文本编码器与对比学习,引入随机丢弃视觉token技巧,性能佳且效率高,挑战了对比学习范式。

机器之心
新闻资讯8

赵长鹏投了一个华人大三学生,1100 万美元种子轮,做教育 Agent

华人大三学生 Kai Zhao 创立的教育 Agent 产品 VideoTutor,获 1100 万美元种子轮融资。该产品主打生成专属教学视频,解决 K12 美国高考学习痛点,团队技术与市场表现出色,还分享了硅谷大学生创业趋势。

Founder Park
开源动态8

清华开源|做一门课要3天?用 OpenMAIC,30分钟生成完整互动课堂|GitHub 15.6k

OpenMAIC 是清华开源的 AI 互动课堂平台,能将主题或学习材料快速转化为完整互动学习体验。它把课堂拆成多种交互组件,架构设计出色,支持多 LLM 服务商,还能在聊天应用生成课堂。

小华同学ai
算法论文8

ICLR 2026 | 从「聚合」到「引导」:FedDRM开启客户端智能路由新范式

传统联邦学习中,统计异质性是障碍,本文提出 FedDRM,将联邦学习从「聚合范式」拓展到「路由范式」,让服务器能把问题交给最合适的客户端处理,在多数据集上提升系统准确率,为多场景提供新可能。

机器之心
算法论文8

大模型长脑子了?研究发现LLM中层会自发模拟人脑进化

帝国理工学院等机构研究人员发表论文,指出大型语言模型(LLM)学习中会自发演化出类似生物大脑的协同核心结构。研究对多个模型剖析,揭示其内部处理规律,为大模型可解释性开辟新路径。

机器之心