学习搭子」共找到 1566 篇相关文章

算法论文8

极简主义的胜利:清华团队用最简单的强化学习配方刷新1.5B模型纪录

清华、伊利诺伊大学和上海AI实验室团队提出JustRL架构,仅用单阶段训练和固定超参数,在1.5B模型上刷新性能纪录,计算量仅为复杂方法50%,挑战了复杂技术堆叠现状。

AIGC开放社区
算法论文8

陈丹琦新作:大模型强化学习的第三条路,8B小模型超越GPT-4o

陈丹琦团队提出结合RLHF和RLVR优点的RLMT方法,支持在基础模型上直接使用,节省后训练成本。它让模型生成CoT,用奖励模型评价输出,使小模型超越大模型,推理更像人类。

量子位
推荐文章8

从 0 到 1 做一款 AI 产品:技术怎么、成本如何控制、销售策略怎么定?

独立开发者 Arvid Kahl 分享从零构建 AI 播客产品 Podscan 及「节俭工程」经验,涵盖技术建、成本控制与销售策略调整。如用小众云服务降成本,从 PLG 转向 SLG 等,为小团队创业者提供实用借鉴。

Founder Park
开源动态8

突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度

在多模态大语言模型应用多元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。

量子位
算法论文8

不用递归自动微分,也能稳定计算高阶 PDE 导数? Mollifier Layers 如何改造 PDE 反问题学习

本文介绍《Mollifier Layers: Enabling Efficient High-Order Derivatives in Inverse PDE Learning》,指出传统PINN递归自动微分计算高阶PDE导数有瓶颈,Mollifier Layers用解析卷积替代,实验显示其在精度、效率上有优势,也有核选择等局限。

力学与人工智能
推荐文章8

480万人围观的Claude code实战使用指南进阶来了:一文讲清Skill,代理和MCP

Eyad发布Claude Code开发实战进阶篇,深入剖析其底层系统的Skills、Subagents和MCP connectors三大核心能力。通过对比,突出Claude Code在上下文窗口上的优势,还介绍了各功能用法及复合效应。

AI寒武纪
开源动态7

三重Reward驱动的运维智能体进化:多智能体、上下文工程与强化学习的融合实践

文章阐述了AI原生时代下,面向技术风险领域的智能体系统(DeRisk)的架构设计、核心理念等。介绍运维智能体发展现状,提出其技术演进需找三类Reward,还介绍相关概念、DeRisk架构,给出实践案例并将开源技术产品。

阿里云开发者
开源动态8

Agent KB:经验池让Agents互相学习!GAIA新开源SOTA,Pass@1性能最高提升6.66

来自多家机构团队发布 Agent KB 框架,构建经验池实现 AI Agent 经验共享。在 GAIA 基准测试中表现出色,提升多模型 Pass@1 性能,还在软件工程领域展现价值。其设计精妙,经消融、检索策略等实验验证有效。

机器之心
算法论文8

Diffusion约2倍无损加速!训练-推理协同的缓存学习框架来了| HKUST&北航&商汤

HKUST、北航与商汤提出HarmoniCa框架,解决Diffusion模型推理慢、成本高问题。它通过SDT和IEPO机制,解决训练 - 推理脱节,在多模型上实现推理提速、质量提升,且训练推理开销低,已开源。

量子位
开源动态8

万帧照片级仿真,打通视觉机器人学习的感知与物理鸿沟:国产仿真器GS-Playground入选RSS 2026

清华大学等联合提出高通量视觉高保真仿真器GS - Playground,被RSS 2026录用。它解决现有仿真器渲染开销高、资产制作依赖人工、Sim2Real迁移鸿沟大等问题,是全栈重新设计的仿真基础设施。

机器之心