RL 优化技术」共找到 3976 篇相关文章

算法论文8

X上63万人围观的Traning-Free GRPO:把GRPO搬进上下文空间学习

年初 DeepSeek - R1带火大模型强化学习,GRPO成常见RL算法,但训练成本高。腾讯优图论文提出Training - Free GRPO,将GRPO训练范式迁移到上下文学习,成本低、泛化好,已开源。

机器之心
新闻资讯8

新紫光集团三周年:智变跃升,交出硬核答卷

2025年7月11日新紫光集团完成战略重整三周年,交出硬核答卷,连续三年营收超千亿,专利增加。其聚焦智能科技主业,通过战略布局、技术攻坚、生态协同实现发展,未来将持续求新求变,深化合作。

芯师爷
产品应用8

Meshy用户破千万后杀向新战场:ARR年翻14倍,头部厂商集体买单

Meshy是计算机图形学大神胡渊鸣创立的AI 3D公司,其创意工坊打通“AI创意→实体交付”。Meshy生成模型打印适配度高,破圈至多元领域,注册用户破千万,ARR年翻14倍,获多轮融资。

量子位
开源动态8

FlashAttention-4正式发布:算法流水线大改,矩阵乘法级速度

深度学习领域底层优化技术FlashAttention更新至4版本。其核心作者称在Blackwell GPU上,注意力机制执行速度接近矩阵乘法。新算法克服瓶颈,在B200上性能提升,还获Pytorch官方支持。

机器之心
开源动态8

大模型优秀大脑齐聚硬核开源聚会,SGLang社区举办国内首次Meetup

10月25日,SGLang联合美团、亚马逊云科技在北京举办国内首场Meetup。SGLang是开源高性能推理引擎,特性丰富。活动中大咖和开发者分享见解、进展、应用场景,展现其社区活力与发展潜能。

机器之心
新闻资讯8

英伟达早不靠GPU躺赢!黄仁勋终极预判:10亿程序员时代将至,AI智能彻底廉价

2026 年 GTC 大会后黄仁勋接受深度访谈,他指出 AI 核心竞争转向“AI 工厂”,扩展定律沿四条路径推进,未来大量数据是合成数据。他还预测程序员将达十亿级,强调人人学 AI,认为智能会商品化,人性高于技术

AI前线
新闻资讯8

谷歌TPU逆袭英伟达,创始人一夜之间跃升全球第二、第三富豪

近期谷歌股价飙升,市值逼近4万亿美元,创始人财富排名跃升。其股价上涨源于AI领域双重突破:Gemini 3获赞誉,AI芯片业务有进展。英伟达回应称技术领先,谷歌逆袭有五大原因,如Gemini 3受欢迎等。

机器之心
新闻资讯7

AI助手Cici悄然霸榜海外,又是字节

AI智能助手领域有新玩家,字节跳动的Cici在多个国家应用商店霸榜,数月内下载量爆发式增长。它融合字节旗下技术,文本生成用到OpenAI、谷歌模型。同时,豆包在国内AI智能助手赛道全维度领先。

量子位
产品应用8

构建企业级 AI 应用:为什么我们需要 AI 中间件?

9月26日云栖大会,阿里云资深技术专家林清山发布阿里云AI中间件,核心技术全面开源。文章指出2025年是Agentic AI爆发元年,分析AI原生应用架构变革,介绍阿里云AI中间件构成及优势,助力企业级AI应用落地。

阿里云开发者
开源动态7

强化学习+MCP=王炸?开源框架教AI在MCP中玩转工具解决任务,实测效果超越GPT!

科技公司OpenPipe提出全新开源强化学习框架MCP·RL,只需一个MCP Server地址,agent就能自动发现工具、生成任务,在闭环反馈中摸索出最优调用策略,实测在2/3的benchmark上达或超SOTA性能。

量子位