RL系统」共找到 1917 篇相关文章

开源动态8

3A大作!阿里ROLL团队从基建->算法->机理,推动RL4LLM全栈协同优化

阿里巴巴ROLL团队联合高校推出「3A」协同优化框架,推动「强化学习用于大语言模型(RL4LLM)」迈向新范式。Async架构提升GPU利用率,AsyPPO降低计算资源消耗,Attention机制提升训练效率与可解释性。

机器之心
新闻资讯7

AI搜索引擎领域大哥Perplexity AI 三层重排序系统与核心排名因素揭秘,必看!

国外研究人员分析揭示Perplexity AI部分排名规则和因素。其有三层重排序系统,人工配置权威域名,热门话题与YouTube相关。还总结8个核心排名因素,并给出SEO优化策略,体现搜索重质量趋势。

白杨SEO优化教程
产品应用7

爆删80%系统提示词!Anthropic核心成员揭秘Claude 5最新玩法:上下文工程全面大换血

Anthropic针对Claude Opus 5、Claude Fable 5等新模型,删超80%Claude Code系统提示词,编码测试成绩无明显下降。CC技术团队成员发文指上下文工程规则重写,还总结新旧规则对比,并给出内容撰写建议,还上线新命令。

AI寒武纪
新闻资讯7

AI大厂系统提示词泄露:2.7万token里,藏着最好的提示工程课

GitHub上`system_prompts_leaks`仓库扒出Claude、GPT等AI系统提示词。这些提示词像事故档案,规则具体,其结构排序暴露优先级。普通使用者可借鉴,提升对AI提要求的质量。

AI Reading Hub
新闻资讯8

谷歌AI新里程碑:一个能「做研究」的系统诞生了,用LLM+树搜索编写专家级软件

谷歌提出能帮科研人员编写「专家级」科研软件的AI系统,融合大语言模型和树搜索,可整合重组知识构建新思路。在多领域超人类表现,但局限于可量化任务。

机器之心
算法论文8

AI 如何讲好一个多人故事?首个支持多角色互动的3D场景叙事系统

首尔国立大学提出全新框架,能生成虚拟动态场景并支持多角色上下文动作生成。引入LLM拆解复杂任务,系统用事件驱动方式规划动作,还构建基准评估相关能力,有良好扩展性和实用性。

带你学AI
新闻资讯8

世界最老程序员——这个91岁的老码农用AI 搞了个教会志愿者管理系统

91岁从未碰过代码的John Blackman,在孙子介绍下,用Claude和Replit的AI agents,仅两天就搭建出教会志愿者管理系统,还分享开发到生产的挑战及使用反馈。

AGI Hunt
开源动态8

首个开源实现100%可复现的稳定RL训练框架来了!2次结果完全重合

SGLang团队联合slime团队开源实现100%可复现的稳定RL训练框架。基于Qwen3 - 8B重复实验结果完美重合。SGLang在批次不变算子基础上实现确定性推理,性能有下降但有提升空间,还给出使用方法和未来规划。

量子位
算法论文8

智能体如何学会「想象」?深度解析世界模型嵌入具身系统的三大技术范式

长期以来具身智能系统缺预测力,世界模型让智能体有了‘想象’未来的能力。中科大等机构团队综述将现有研究划分为模块化、顺序、统一三大架构集成范式,并指出未来研究方向。

机器之心
推荐文章8

全面解析 Agent Engineering 的 10 大工程维度:生产级 Agent 系统的炼成之路。

技术突破让AI智能体成热点,但应用走向真实业务暴露出工程瓶颈。本文围绕智能体工程及其10个核心维度,剖析从“不确定的LLM能力”到“可靠的生产级Agent系统”的炼成之路。

AI大模型应用实践