「强化学习微调」共找到 1684 篇相关文章
OpenAI久违发了篇「正经」论文:线性布局实现高效张量计算
OpenAI 近日发布研究论文,提出用于高效张量映射的统一代数框架 Linear Layouts,解决了 Triton 等深度学习编译器中长期存在的难题。该框架是使用二元线性代数的张量布局通用代数形式,评估显示其优化版 Triton 性能有提升。
315 行代码构建编程助手,Go大佬揭开智能体的「神秘面纱」
知名Go大佬Thorsten Ball用315行代码构建编程智能体,虽无法与Claude、Gemini等编码功能媲美,但为初学者提供学习范例。文章分享构建步骤,包括准备工作、添加工具等,展示如何让智能体与Claude对话及使用工具。
让AI自我进化,斯坦福新课免费教
斯坦福开设新课CS329A《自我进化AI智能体》,被奉为Agent学习新晋资源宝库。课程由实战派教授授课,介绍扩大模型规模、养成能听懂人话的AI、提升AI能力等内容,还探讨AI自我改进及智能体工作流等。
显卡为什么卖得越来越贵?NVIDIA 副总裁:别争了,摩尔定律早就死透了
NVIDIA应用深度学习研究副总裁Bryan Catanzaro在播客中指出,嘲笑中国AI“套壳抄袭”是偏见,中国在开源协作上是全球领跑者。他认为摩尔定律已死,显卡难降价,还分享了对开源闭源、模型技术等看法。
让大模型学会「自己教自己」!京东&中科院信工所连发三篇论文定义Self-Taught RLVR
京东和中科院信工所开展Self - Taught RLVR系列研究,连发三篇论文。从RLSD、NPO、CoPD三个维度探索让大模型自我指导。如RLSD解决信息泄漏,NPO引入有效学习信号,CoPD整合多专家能力,各有创新与良好效果。
没有AI也能活得很好的公司,才能用好AI
多数企业推进AI时,虽采纳率高但效果不佳,投入大回报低。问题核心不在AI,而在企业自身组织学习和集成准备度。能从AI获益的是原本就运营良好的公司,当下应审视自身是否适合用AI。
龙虾史上最大升级!但接了微信的千万别更
时隔九天,虾父Peter带来龙虾全新版本2026.3.22-beta.1,堪称有史以来最大更新。更新亮点包括插件升级、模型更新、交互优化、安全强化等,也修复了多个关键安全漏洞,但部分用户更新后遇到微信、WhatsApp使用问题。
刚刚,马斯克开源基于 Grok 的 X 推荐算法!专家:ROI 过低,其它平台不一定跟
马斯克时隔近三年再次开源X推荐算法,该算法基于Grok,采用端到端学习预测用户兴趣。不过有争议认为这或是因现实压力。专家称其ROI低,其他平台不一定跟进,且此次开源对学术研究价值不大。
通往通用人工智能的关键一步?DeepMind放大招,3D世界最强AI智能体SIMA 2
Google DeepMind发布SIMA 2,这是能在虚拟3D世界自主游戏、推理和学习的通用AI智能体。它集成Gemini模型,从指令跟随到主动认知跃进,泛化性能提升,还具备自我提升能力,为AI和机器人技术发展提供新路径。
OpenAI发布新模型硬刚Anthropic!Claude Code刚火,就被GPT-5-Codex拍在沙滩上?
9月15日,OpenAI推出新模型GPT - 5 - Codex,是微调的GPT - 5变体,用于AI辅助编程。它增强了代码审查功能,能动态调整思考时间,在多项基准测试中表现优于GPT - 5,发布后引发网络热议,AI编码工具市场竞争激烈。