上下文强化学习」共找到 2074 篇相关文章

推荐文章7

统计学和机器学到底有什么区别?

文章探讨统计学和机器学习的区别,指出两者目的不同,统计模型重推断关系,机器学习重预测。以线性回归为例说明差异,还澄清常见误解,表明机器学习基于统计学但涉及多领域,最后称选方法要看目标。

海边的拾遗者
开源动态8

小扎又开源了:7B实现自监督学习SOTA

Meta发布全新开源视觉模型DINOv3,首次证明自监督学习模型能在广泛任务中超越弱监督学习模型。它用无标注方法,扩展数据和模型规模,支持标注稀缺场景,在多任务实现SOTA。

量子位
推荐文章7

精打细算虾养成指南: 省 Token 和把 AI 用好,从来就是一件事

文章指出用AI时Token成本高、模型变笨,原因是上下文管理不善。介绍了省Token和用好AI的方法,如按需取上下文、明确约束、多智能体协作、按阶段切换模型等,核心是在合适时间将合适上下文装入合适模型。

腾讯技术工程
开源动态8

上下文快2.9倍,解码快6倍:Kimi 用线性注意力实现性能与效率双突破

月之暗面团队的Kimi Linear模型,是混合线性注意力架构,核心是Kimi Delta Attention模块。它解决线性注意力的记忆及遗忘问题,在多任务测试表现出色,还开源相关资源,推动高效长上下文模型研究。

AIGC开放社区
开源动态8

9.1K Star 调参师集体失业!亚马逊造出机器学习“核弹”,3行代码打造高精度模型!

在机器学习普及的当下,自动化机器学习框架降低开发门槛。AutoGluon由AWS AI开发并开源,仅3行代码就能训练和部署高精度模型,支持多类型数据,有诸多亮点,已获9.1K Star。

开源星探
开源动态8

Agent的自演进,被刚刚开源的AReaL 2.0按下了加速键

Agent 正从「会使用工具并完成任务」向「在使用中学习并改进方法」转变,但面临自演进难题。AReaL 2.0 上线,解决 Agent 服务侧问题,给出在线学习闭环方案,其价值已在实践中得到验证。

机器之心
算法论文8

告别纯奖励试错!二次尝试+反思蒸馏,复杂任务提升81%

美国南加州大学和宾夕法尼亚大学团队提出新训练范式ERL,将「经验学习」引入强化学习,通过二次尝试和反思蒸馏,在复杂任务中性能显著提升,为构建长期自主智能体提供新思路。

新智元
算法论文8

Embedding黑箱成为历史!这个新框架让模型“先解释,再学Embedding”

来自多高校研究人员推出可解释的生成式Embedding框架GRACE,解决传统文本表征模型黑箱式表征瓶颈。它重新定义对比学习信号,含三个关键模块,训练双模式统一,实验跨任务提升且不损生成能力。

量子位
算法论文7

「Next-Token」范式改变!刚刚,强化学习预训练来了

微软新研究提出「强化预训练(RPT)」新范式,将下一个 token 预测任务重新定义为推理任务,可利用海量文本数据进行通用强化学习。该方法有可扩展性、低风险等优点,实验显示其提升了语言建模能力。

机器之心
新闻资讯7

Nature重磅发文:深度学习x符号学习,是AGI唯一路径!

大模型虽惊艳,但权威认为仅靠神经网络难达人类级智能。符号AI曾被边缘化,如今‘神经–符号融合’升温。神经网络与符号算法各有利弊,业界探索出不同融合路径,不过对其能否通往AGI仍存争议。

新智元