「在线体验学习」共找到 2142 篇相关文章
软件行业“快时尚化”背后的经济学 | AGIX PM Notes
本周市场对软件看法悲观,OpenAI CEO 警告软件或进入‘快时尚时代’。但软件行业会升维,一是从‘死’变‘活’,具备元学习能力;二是定价更极致。还介绍了本周市场总结及多起 AI 相关企业动态。
DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO
文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。
GPT-5内测抢先公布:日常推理首次击败人类,编程数学科学问题能力都很强
疑似GPT - 5发布预告刚出,内测体验抢先释出。网友实测其推理能力首超人类,编程、数学等能力也出色,虽提升或没GPT - 3到GPT - 4明显,但市场竞争激烈,8月8日凌晨OpenAI发布或为GPT - 5。
独家 | 腾讯X Lab 韩磊即将离职,将加入诺亦腾科技
AI 科技评论独家获悉,腾讯具身智能技术中心副总经理韩磊 7 月底离职,将加入诺亦腾科技。韩磊在多智能体强化学习成果多,其参与研究登上《Nature Machine Intelligence》2024 封面,加入诺因该司有大量动捕数据。
Day0迁移、一键部署,华为开源的昇思MindSpore成为大模型开发的“万能钥匙”
在大模型无法一统天下的背景下,开发者面临在一个框架、生态体验众多主流大模型和AI技术的难题。华为开源的昇思MindSpore可实现训练Day0迁移、推理一键部署,还介绍了其相关技术和实测效果。
「Next-Token」范式改变!刚刚,强化学习预训练来了
微软新研究提出「强化预训练(RPT)」新范式,将下一个 token 预测任务重新定义为推理任务,可利用海量文本数据进行通用强化学习。该方法有可扩展性、低风险等优点,实验显示其提升了语言建模能力。
OpenAI久违发了篇「正经」论文:线性布局实现高效张量计算
OpenAI 近日发布研究论文,提出用于高效张量映射的统一代数框架 Linear Layouts,解决了 Triton 等深度学习编译器中长期存在的难题。该框架是使用二元线性代数的张量布局通用代数形式,评估显示其优化版 Triton 性能有提升。
315 行代码构建编程助手,Go大佬揭开智能体的「神秘面纱」
知名Go大佬Thorsten Ball用315行代码构建编程智能体,虽无法与Claude、Gemini等编码功能媲美,但为初学者提供学习范例。文章分享构建步骤,包括准备工作、添加工具等,展示如何让智能体与Claude对话及使用工具。
让AI自我进化,斯坦福新课免费教
斯坦福开设新课CS329A《自我进化AI智能体》,被奉为Agent学习新晋资源宝库。课程由实战派教授授课,介绍扩大模型规模、养成能听懂人话的AI、提升AI能力等内容,还探讨AI自我改进及智能体工作流等。
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本
大模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是学完了。腾讯混元团队发现SFT存在不完全学习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。