后训练课程」共找到 3805 篇相关文章

推荐文章7

一个极度实用的Prompt,帮你挖掘出自己的隐藏天赋。

作者朋友被裁认为自己没天赋,作者由此思考天赋问题,花时间迭代出挖掘天赋的Prompt,借助AI与人深度对话,根据回答输出天赋报告,还举例自己找到天赋的经历,强调找到天赋的重要性。

数字生命卡兹克
算法论文8

推理即排序:ReasonRank反常识的2.7倍效率跃迁,新SOTA比快更快

论文提出新型排序模型ReasonRank,将深度推理能力融入排序流程,突破数据瓶颈,采用创新训练框架,效率比主流点对点排序模型快2.7倍,还介绍方法论、技术突破、实验验证等内容,指出局限与未来方向。

深度学习自然语言处理
产品应用8

打造全球首个强化学习云平台,九章云极是如何做到的?

AI正从语言模型走向智能体,强化学习成关键技术,但训练面临困难。2025年6月九章云极发布全球首个工业级强化学习云平台AgentiCTRL,实现系统级重构,其智能基础设施战略布局领先,具产业赋能优势。

机器之心
新闻资讯7

Altman拿Token换股权只够烧45天,20亿Token捐母校只值100块:Token真成“钱”了,谁更赚?

本文围绕AI Token展开,讲述OpenAI用Token换创业公司股权,00捐20亿Token给母校,还探讨了“tokenmaxxing”现象及问题,指出AI行业经济账未算清,企业客户成本高,AI成管理层压迫工具。

InfoQ
开源动态8

HF日趋榜一!真端到端模型AutoDeco终结手动调参解码

大语言模型手动调参解码繁琐,腾讯AI Lab王琰团队联合港中大(深圳)唐晓莹教授团队推出AutoDeco架构,通过创新训练策略让模型动态预测解码参数,在多模型实验中表现出色且已开源。

机器之心
新闻资讯8

OpenAI和DeepMind大佬离职联手,誓用AI科学家实现室温超导!已融3亿美元

OpenAI训练负责人和DeepMind的AI4S大佬离职成立Periodic Labs,专注用AI Agent改造科研,攻克室温超导等难题,已获3亿美元融资。团队目标是培养AI科学家,构建自主实验室,还将应用于产业。

新智元
技术分析类文章7

Pingpong Schedule并不是万能钥匙

SGLang社区开发者反馈,SM90 FP8 Blockwise Scaling Grouped GEMM从H20迁移至H800性能下降。文章分析是Pingpong调度策略所致,因算力提升,其使TensorCore未充分利用、TMA效率低,建议用Cooperative策略。

GiantPandaLLM
新闻资讯7

奥特曼:点名表扬两个波兰人,OpenAI还没遇到过他们解决不了的问题

奥特曼点名表扬OpenAI两位波兰科学家Jakub Pachocki和Szymon Sidor,他们贡献从Dota项目扩展强化学习到领导GPT - 4预训练。2023内乱中他们追随奥特曼,帕哥成首席科学家,西哥为独立贡献者。

量子位
算法论文8

Think in Games:做一个在王者荣耀中会玩和思考的Agent

文章介绍论文《Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models》,指出当前AI在游戏领域面临的困境,提出TiG框架结合大语言模型与强化学习,打造既会做又会说的AI,实验验证其高效性。

深度学习自然语言处理
新闻资讯8

Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键

Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。

Founder Park