时间衰减奖励」共找到 619 篇相关文章

产品应用7

还不会用 OpenClaw?已经有人靠龙虾月入 7 万美元了

文章介绍 OpenClaw 的应用场景,如国外小哥靠它和 11 个应用月赚 7.3 万美元。还阐述其在自动化内容、找网红合作、客户支持、KPI 报告及 X 与 YouTube 内容自动化等方面的作用,强调能节省时间和成本。

特工宇宙
算法论文8

LLM记忆管理终于不用“手把手教”了,新框架让智能体自主管理记忆系统

加州大学圣地亚哥分校和斯坦福大学研究人员提出强化学习框架Mem-α,用于训练LLM智能体自主管理记忆系统。它将记忆构建转为序列决策问题,采用多维度奖励函数,实验显示其全面超越现有方法。

量子位
产品应用8

这个Coding Agent框架要火!Cursor、Claud太慢了

AI Agent赛道爆发,开发编码代理效率低。新出的jcode框架将Coding Agent功能整合,解决痛点,内存效率高、启动快、资源占用少,还能为开发者省80%底层开发时间。这是赛道成熟信号。

CourseAI
算法论文8

Meta&UIUC大发现:无需标注,Agent复杂的工具使用和搜索能力,是可以“无中生有”的

Meta和UIUC研究发现,无需标注,Agent复杂工具使用和搜索能力可“无中生有”。论文Dr. Zero让大模型自我博弈成搜索专家,用HRPO提效,设计难度导向奖励,实验表现佳,但也存在局限。

深度学习自然语言处理
开源动态8

字节跳动开源超强USO模型,AI绘图六边形战士来了

在AI图像生成领域,风格和主题驱动的图像生成一直脱节。字节跳动智能创作实验室推出USO模型,构建海量数据集,设计两阶段训练法,引入风格奖励学习范式,化解此难题,且已全面开源。

AIGC开放社区
算法论文8

Agentic RL 后训练资源怎么分?港中文、恒生大学提出 Libra,吞吐最高提升 3 倍

大语言模型走向“完成任务”,Agentic RL 后训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。

机器之心
新闻资讯8

AI进化时间表已现!LLM每7个月能力翻倍,2030年职场不复存在?

LLM正飞速进化,METR研究发现其智能每7个月翻番。到2030年,一个模型几小时就能完成人类工程师数月的工作。该研究提出“任务完成时间视野”指标衡量模型能力,不同模型表现差异大。

新智元
产品应用7

一晚上,用AI干了7个PPT,我发现了一个让PPT设计师失业的方法

作者一晚用AI做7个PPT,分享让PPT设计师失业的方法。介绍苹果风格PPT效果,阐述10分钟搞定专业PPT的核心步骤,还对比了传统与AI方式的时间成本,最后预告下期分享内容。

AI 产品自由
推荐文章7

不自研、只收购,年入7亿美金,全球最赚钱的应用工厂是如何做成的?

Bending Spoons是欧洲非游戏类应用工厂,靠收购模式年入7亿美元。创始人Luca Ferrari称收购是买时间和优势,解锁被收购公司潜力。公司核心竞争力是内部系统,还回应了裁员争议,也谈及未来规划。

Founder Park
开源动态8

社区供稿 | Index-AniSora 技术升级开源: 动漫视频生成强化学习

B站升级动画视频生成模型Index - AniSora技术并开源,支持多种二次元风格视频镜头一键生成。基于相关研究提出首个专为二次元视频生成的强化学习技术框架,构建奖励数据集、训练AnimeReward、提出GAPO优化策略,实验验证其有效性。

Hugging Face