人才策略」共找到 1217 篇相关文章

算法论文8

LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制

中国科学院自动化研究所与腾讯AI Lab团队从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上性能显著优于传统算法。

深度学习自然语言处理
新闻资讯7

误入人均10个顶级offer的技术天团活动,顶尖AI人才的选择逻辑我悟了

作者参加京东TGT计划活动,与两位入职京东的顶尖AI人才交流。Daniel因京东重视生成式推荐项目、技术氛围纯粹而选择它;Kyrie则被创业热情、技术理想共鸣及数据优势吸引。入职后两人都获核心项目机会。

量子位
算法论文8

港科提出新算法革新大模型推理范式:随机策略估值竟成LLM数学推理「神操作」

香港科技大学联合团队提出 ROVER 算法,跳过传统强化学习推理的策略迭代循环。它在多项数学推理基准上超越现有方法,在高难度任务中大幅提高 pass@1 和 pass@256,且提升推理多样性,更轻量。

机器之心
算法论文8

多模态模型学会“按需搜索”,少搜30%还更准!字节&NTU新研究优化多模态模型搜索策略

字节与NTU优化多模态模型搜索策略,通过搭建工具、构建数据集及设奖励机制,用强化学习训练模型,使其按需搜索。实验显示,MMSearch - R1系统少搜30%还更准,为多模态大模型发展提供洞见。

量子位
新闻资讯8

吴恩达:一边是CS毕业生“过剩”,一边是AI人才抢破头,问题出在哪?「cs专业依然是王牌」

吴恩达分享对CS专业人才市场的观察,指出市场对AI开发者需求未满足,而新毕业CS学生失业率上升。根源是高校课程未跟上AI提升编程生产力的步伐,还阐述了AI工程师核心能力及人才短缺趋势等。

AI寒武纪
算法论文8

监督学习也能从错误中学习反思?!清华英伟达联合提出隐式负向策略爆炸提升数学能力

清华大学与英伟达、斯坦福联合提出监督学习方案NFT,在RFT算法基础上构造“隐式负向模型”利用负向数据训练。该策略弥合监督与强化学习差距,其损失函数梯度和GRPO在On - Policy条件下等价。

量子位
算法论文8

腾讯混元 x MBZUAI 港中文新研究:将纠错纳入策略空间,Search-R2 重构搜索增强推理学习方式

过去大语言模型能力提升靠参数和数据扩张,但在真实任务中此路径有局限。腾讯混元、MBZUAI、港中文联合团队提出Search - R2,将纠错纳入策略空间,抑制错误传播,在多跳推理任务中优势显著。

AI科技评论
产品应用7

102.4 亿 AI 数字人市场下:华为云 × 今日人才如何打造能用且好用的数智员工?

当前多数企业将 AI 作辅助工具,先锋玩家则将其“超级能动性”用于“数智员工”。数智员工应用面临挑战,华为云与今日人才合作打造产品,如政务数智员工,还构建培育体系,推动其从辅助向协同升级。

InfoQ
推荐文章7

《中国金融机构人才发展与培训白皮书(2026)》发布!助力金融机构打造“人 + 智能体”协同的超级员工梯队 | 极客时间企业版

在AI时代,金融人才培养正经历深刻变革。《中国金融机构人才发展与培训白皮书(2026)》应运而生,揭示了AI重塑金融人才培养的关键发现,极客邦科技和极客时间企业版也给出了相应方案。

AI前线
新闻资讯7

千问负责人突然离职,阿里回应

3月4日凌晨,千问团队核心人物林俊旸突然宣布卸任,引发业内关注。其离职时间点较突然,且前后千问团队还有其他核心成员变动。3月5日,阿里巴巴CEO吴泳铭回应,称公司将坚持开源策略,加大AI研发和人才吸纳。

芯师爷