RL4LLM」共找到 2578 篇相关文章

推荐文章7

从零开始200行python代码实现LLM

文章从传统思路出发,用Python实现极简大语言模型,介绍从零基础到Bigram模型的过程,包括词汇表、模型训练推理等内容,还讲解了PyTorch基础,最后实现pytorch版Bigram模型,后续将实现完整GPT。

阿里云开发者
新闻资讯7

扣子 Agent 创作者榜单 - 2025.4

2025 年大模型和 Agent 渐入大众视野,虽大家对 Agent 理解有别,但它落地效果和想象空间大。扣子用户达百万级,此次发布最新创作者榜单,后续还将发相关内容。

特工宇宙
算法论文8

微软:LLM上下文学习并非真的学习!

微软研究指出大模型上下文学习(ICL)虽数学上符合学习定义,但只是拟合prompt内统计规律,非掌握任务本质。通过大量实验,得出如例子越多模型表现越好、语言不重要统计重要等7条关键发现。

PaperAgent
新闻资讯7

AI Agent放贷款,获投4.3个亿

Salient是一家主打AI agents贷款服务的公司,在A轮融资筹6000万美元。它为消费金融打造平台,推出语音AI agent等业务,能提升效率、确保合规,已与多家贷方和银行合作,效果显著。

量子位
算法论文8

普林斯顿发现RLHF显著加剧了LLM胡扯!

普林斯顿研究提出‘机器胡扯’概念,构建分析框架,含胡扯指数、行为分类法和评测集。实验揭示RLHF加剧胡扯,政治语境模型爱‘打太极’,为构建诚实AI提供工具和理论。

深度学习自然语言处理
开源动态8

多 Agent 并行,手机也能用,已经 4 万星!

GitHub上项目Orca是专为「并行Agent」做的开发环境,开源4个月揽4万+ Star。它让多个Agent在独立git worktree里并行干活,互不干扰,还支持近30款主流Agent,另有多种实用功能,安装也简单。

开源先锋
新闻资讯7

deepseek v4.1? 梁圣的端午礼物突袭。

群里小伙伴称deepseek官方灰度新模型,手机和web端Flash模型思考模式大变,典型bug修复。测试发现幻觉严重,知识库截止大概25年6月。同时,deepseek获500亿首轮融资,梁文锋自掏200亿,投资方无投票权,五年锁定期。

探索AGI
开源动态8

港大nanobot4,000行代码复刻Clawdbot

港大nanobot用4000行代码复刻Clawdbot,解决AI从‘被动回答’到‘主动服务’问题。它有核心架构Agent Loop,三大主动触发机制,模块化设计,还坚持少即是多原则,让AI成自动化助手。

CourseAI
算法论文8

Meta&CMU:Token级LLM协同路由新范式

Meta AI、CMU等联合推出FusionRoute,是让多个大模型在token级协作的新范式。它能在每个token位置精准选专家,自带“急救包”。经实验验证其高效,也指出了待研究的方向。

PaperAgent
开源动态8

OpenAI 迈出关键一步:LLM 黑盒不再是盲盒

OpenAI开源新研究成果,提出全新范式,训练权重稀疏的Transformer模型以提取人类可理解的电路。该方法分三步,关键结果显示稀疏模型优势多,但也存在训练成本高、规模有限等局限,还给出两条未来路线。

PaperAgent