员工奖励」共找到 593 篇相关文章

新闻资讯8

卡帕西入职Anthropic仅两月疑离职;日媒拆解宇树G1后认输:短期内赶不上中国;腾讯317万年终奖员工被辞退:永不录用|AI周报

这篇 AI 周报涵盖诸多热点,如 AI 大神 Karpathy 入职 Anthropic 两月疑离职;Kimi K3 超越闭源模型引关注,美指控其蒸馏美模型;腾讯员工晒 317 万年终奖被辞退;360 首任董秘追讨股权;多家公司有模型发布、业务调整等动态。

AI前线
新闻资讯7

OpenAI强硬回击马斯克窃密诉讼!xAI被指恶意人肉离职员工

被马斯克xAI起诉窃密一周后,OpenAI回应,递交答辩状和驳回动议申请,全面否认指控,斥责马斯克滥用诉权滋扰。xAI提出三项指控,OpenAI则逐一驳斥,称招聘合法合规,未接触其机密。

量子位
推荐文章7

越靠经验思考的岗位,越先被取代!OpenHex董舒:AI数字员工正在催生OPC一人公司

OpenHex董舒认为AI最大价值是替人出面干活,提出数字员工概念。他指出判断力密度高的岗位易被AI取代,中国服务业有发展机会。还辨析数字员工类型,介绍其平台OPS Agent,最后分享了数字员工相关Q&A。

AI科技大本营
算法论文7

见微知著:LLM 奖励建模的「Analytic Rubric」范式全面综述

该文是对LLM奖励建模的「Analytic Rubric」范式的全面综述。介绍了Rubric概念来源,指出传统奖励模型存在对齐风险,而Rubric RM在多方面取得平衡,还阐述其工作流、各维度研究情况及面临的挑战。

深度学习自然语言处理
算法论文8

北大腾讯突破奖励模型瓶颈!让AI理解人类偏好,泛化能力比肩GPT-4.1

北京大学知识计算实验室联合腾讯等机构提出RewardAnything,突破奖励模型瓶颈。它让奖励模型理解自然语言评判原则,降低成本,泛化能力比肩GPT - 4.1,还能用于定制AI行为模式。

量子位
算法论文8

关键突破:理论验证了 RL for LLM 路线的可行性

传统RLHF依赖人工标注偏好数据训练奖励模型,成本高且难扩展。本文发现任何通过Next - token预测训练的LLM内部隐含通用奖励模型,从理论和实验证明其可高效实现模型对齐。

深度学习自然语言处理
新闻资讯7

微软:81% 企业考虑增设 AI 岗位,未来员工会成为智能体的老板

微软发布报告显示,中国企业对 AI 应用认知转变,84%企业决策者将重新评估 AI 影响,81%企业考虑增设 AI 岗位。企业落地 AI 有三阶段,智能体以“数字员工”角色进入企业,员工与 AI 关系重要。

InfoQ
算法论文8

从打分器到思考者:RM-R1用推理重塑模型价值判断

伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。

机器之心
算法论文7

逆强化学习全新视角的大模型对齐技术

文章从逆强化学习(IRL)视角回顾LLM对齐进展。先介绍强化学习基础及挑战,将LLM生成过程化为MDP,探讨无奖励函数的MDP,说明需神经奖励模型,还阐述通过奖励建模实现IRL及多种优化方法。

PaperAgent
新闻资讯7

鹅厂员工都是怎么被AI“糊弄”的?

文章邀请鹅厂同事分享被AI“糊弄”的离谱事件,如AI在发票报销、数学计算、编程问题等方面出错,还会编造不存在的信息,其“系统性可信”假象比单纯答错更危险。

腾讯技术工程