奖励机制」共找到 1058 篇相关文章

8

分布式事务:共识之外,分布式系统状态管理的另一大基石

文章深入探讨分布式系统中“共识”与“事务”的区别与协同,介绍分布式事务的应用场景、实现范式、隔离级别,还阐述 MVCC 机制及其在并发控制、版本存储等方面的应用,最后调研业界数据库产品的事务实现。

阿里云开发者
算法论文8

Anthropic最新论文:检测LLM内省意识的方法

Anthropic与MIT等研究表明,LLM能‘感知’被注入的steering vector,‘内省意识’在DPO等后训练阶段涌现。研究构建实验,发现内省能力行为稳健、检测非简单线性关联等,还揭示检测与识别机制不同及两阶段电路。

PaperAgent
开源动态8

AI记忆革命爆发!Clawdbot如何像大脑般记住一切

2026年初开源个人AI助手Clawdbot引爆社区。它可本地运行、集成聊天平台、自主处理任务,有长时记忆和任务执行能力。AI研究工程师Manthan Gupta复盘其记忆机制原理,涉及上下文、记忆存储、搜索等内容。

新智元
算法论文8

GraphRAG圈新秀:文档级RAKG

随着大模型能力增强,知识图谱成研究热点。传统KGC有实体消歧难、模式僵化等痛点。文章提出RAKG框架,将RAG评估机制引入知识图谱构建,实现文档级自动化构建与评估,多指标表现优异。

PaperAgent
算法论文8

LLM记忆管理终于不用“手把手教”了,新框架让智能体自主管理记忆系统

加州大学圣地亚哥分校和斯坦福大学研究人员提出强化学习框架Mem-α,用于训练LLM智能体自主管理记忆系统。它将记忆构建转为序列决策问题,采用多维度奖励函数,实验显示其全面超越现有方法。

量子位
算法论文8

VLM剪枝新SOTA:无需重训练,注意力去偏置超越6大主流方案

常用的attention机制存在位置偏置和padding异常,影响剪枝效果。上海大学曾丹团队提出无需重新训练的attention去偏方法,在多模型、剪枝策略及基准上验证有效,为多模态模型部署提供新思路。

新智元
算法论文8

Meta&UIUC大发现:无需标注,Agent复杂的工具使用和搜索能力,是可以“无中生有”的

Meta和UIUC研究发现,无需标注,Agent复杂工具使用和搜索能力可“无中生有”。论文Dr. Zero让大模型自我博弈成搜索专家,用HRPO提效,设计难度导向奖励,实验表现佳,但也存在局限。

深度学习自然语言处理
新闻资讯8

10级漏洞刚补完,React又炸了!现代Web“默认底座”因一行代码缺失引发全球地震,开发者经历最黑暗一周

12月12日,React官方确认RSC里有两处新漏洞。此前React2Shell漏洞危害大,超两百万台服务器有风险,开发者服务器被入侵挖矿。该漏洞因核心通信机制缺一行校验代码,Vercel等平台受波及。

InfoQ
开源动态8

字节跳动开源超强USO模型,AI绘图六边形战士来了

在AI图像生成领域,风格和主题驱动的图像生成一直脱节。字节跳动智能创作实验室推出USO模型,构建海量数据集,设计两阶段训练法,引入风格奖励学习范式,化解此难题,且已全面开源。

AIGC开放社区
算法论文7

原来Scaling Law还能被优化?Meta这招省token又提效

2017年《Attention Is All You Need》提出的Transformer是主流语言模型基础范式。Meta新论文提出旋转不变型三线性注意力机制,证明其表现能改变Scaling Law系数,还证实2 - simplicial Transformer在有限token预算下更优。

机器之心