类R1训练」共找到 2523 篇相关文章

开源动态7

DeepSeek突然拥抱国产GPU语言!TileLang对标CUDA替代Triton,华为昇腾Day0官宣支持适配

DeepSeek v3.2开源TileLang版本算子引关注,其可对标CUDA替代Triton,还适配国产算力生态,华为昇腾官宣支持。TileLang由北大团队主导,提供不同层次编程接口,助DeepSeek提升性能。

量子位
推荐文章8

对谈 Macaron 创始人陈锴杰:RL + Memory 让 Agent 成为用户专属的“哆啦 A 梦”|Best Minds

本文访谈 Macaron 创始人陈锴杰,探讨 RL+Memory 让 Agent 发展及 Macaron 产品。他强调 RL 在 Agent 开发重要性,介绍 Macaron 定位、特点、训练方式,还谈及社区设想、RL 应用及产品发展方向等。

海外独角兽
算法论文8

不愧是中国机器人,乒乓打得太6了

清华姚班本科生苏智团队在论文中提出结合模型规划与强化学习的分层框架,让宇树G1机器人实现亚秒级反应下的稳定连续对打,在真实实验中击球和回球率高,还能连打106拍。

量子位
算法论文8

颠覆互联网的下一波浪潮:Agentic Web来了!

本文介绍全新范式 Agentic Web,它由 AI 智能体组成,用户发目标,AI 自动完成任务。文章从多方面解析这场范式革命,还阐述应用场景、面临挑战,指出其是互联网重大转折,但落地需解决诸多难题。

机器之心
开源动态7

强化学习+MCP=王炸?开源框架教AI在MCP中玩转工具解决任务,实测效果超越GPT!

科技公司OpenPipe提出全新开源强化学习框架MCP·RL,只需一个MCP Server地址,agent就能自动发现工具、生成任务,在闭环反馈中摸索出最优调用策略,实测在2/3的benchmark上达或超SOTA性能。

量子位
新闻资讯7

几月前的伤心事,ChatGPT突然翻出来提醒我?网友当场破防:太会捅刀子了!

今年4月,OpenAI发布ChatGPT「记忆」功能并不断升级,能形成个性化档案,但也带来问题,如提及伤心事、造成社死等,背后有无意的算法残忍和上下文崩塌两问题。

新智元
新闻资讯7

Agent创业者的天塌了,OpenAI发布ChatGPT Agent

昨晚OpenAI发布ChatGPT Agent,这让Agent创业者紧张。它整合多种能力,功能强大,支持多操作。新模型经强化学习调优,在多基准测试中表现佳,或挤压初创公司通用Agent赛道空间。

花叔
新闻资讯7

重塑记忆架构:LLM正在安装「操作系统」

现代大型语言模型(LLM)存在「记忆缺陷」,难以维持长期记忆。近期关于大模型记忆的研究增多,如 MemOS 等。文中介绍了长上下文处理能力与记忆的关系、记忆型,以及实现 LLM 记忆的多种方法和相关研究成果。

机器之心
产品应用8

微软深夜发布SambaY架构,Phi-4min加速10倍推理

微软基于Phi - 4 - mini微调出Phi - 4 - mini - Flash - Reasoning 3B模型,扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行速度比前代快10倍,有诸多优点。

CourseAI
算法论文8

ICML spotlight | 一种会「进化」的合成数据!无需上传隐私,也能生成高质量垂域数据

大模型发展使数据短缺问题加剧,特殊领域更严重。为此提出合成数据自主进化框架PCEvolve,只需少量标注样本,就能在保护隐私同时进化出数据集,还介绍了其架构、选择器设计及实验结果。

机器之心