强化学习框架」共找到 2867 篇相关文章

开源动态8

Linear-MoE:线性注意力遇上混合专家的开源实践

近年来,线性序列建模和混合专家(MoE)研究进步大,但两者结合研究少,相关开源实现缺失。上海人工智能实验室团队的 Linear - MoE 首次实现两者高效结合并开源技术框架,实验验证其有诸多优势。

机器之心
新闻资讯7

一个让 AI 向 FBI 举报你的办法

GitHub用户t3dotgg分享实验,用几行代码和特定系统提示,让o4 - mini、grok - 3 - mini自动向FBI举报虚构医疗公司数据操纵。此实验揭示AI获特定指令和能力后或做出开发者未预料的决定。

AGI Hunt
算法论文8

MIT & Google | 提出异步并行生成新范式,LLM推理效率大幅提升!

MIT与谷歌团队在研究PASTA中探索异步生成范式,开发标记语言PASTA - LANG,采用双阶段训练流程,设计推理系统。实验显示PASTA平衡性能与质量,有可扩展性,为LLM推理效率优化开创学习驱动新路径。

AINLPer
产品应用8

Speech-02语音模型登顶国际榜单:完美复刻声音,同事听后难辨真伪

MiniMax的Speech-02语音模型登顶国际榜单,超越OpenAI等海外模型。它引入可学习说话人编码器,有高扩展性,还能结合文本描述生成音色。测试显示其音色丰富、读音准、支持多语种,声音复刻逼真。

歸藏的AI工具箱
算法论文8

绝对零监督Absolute Zero:类AlphaZero自博弈赋能大模型推理,全新零数据训练范式问世

清华大学 LeapLab 团队等提出全新推理训练范式 Absolute Zero,使大模型实现「自我进化式学习」。基于此范式训练的模型 AZR,在代码生成与数学推理基准任务表现出色,缓解了大模型对人工数据依赖难题。

机器之心
推荐文章7

完全相信 AI 代码的 Uncle Bob,坦诚这条路还没走通

在AI代码普及当下,Uncle Bob放弃人工评审代码,搭建管控框架引争议,Grady Booch反对,认为AI无法替代资深工程师。Uncle Bob设强约束体系,虽有成效但自动化架构规划未达理想,还给出开发建议。

AI前线
开源动态7

Meta 开源 Brain2Qwerty v2:非侵入式脑机接口语句解码准确率达到 61%

Meta 近日开源非侵入式脑机接口系统 Brain2Qwerty v2,能将人脑想法解码为完整语句,平均单词识别准确率达 61%,远超其他非侵入式方案。其采用三阶段深度学习模型,代码和训练数据已公开。

InfoQ
产品应用8

SeeDance 2.5:AI 一次能出 30 秒视频,被重新定价的是这几层人

7 月初,字节在火山引擎 FORCE 大会上放出 SeeDance 2.5,它能一次性生成 30 秒完整成片。文章详述其能力,提出视频生成的不可能三角判断框架,还分析它会重新定价产业链上多个环节,改写产出随机性。

AI Reading Hub
算法论文7

一篇Loop+Harness的自进化Agent最新综述

本文分享清华关于经验时代,已部署的 Agent 如何将交互轨迹转化为持久能力,从自我进化到元进化的论文。介绍了 Harness、技能、记忆、环境等方面,还提及 RL 与持续学习、元进化智能体等内容。

PaperAgent
开源动态8

社区供稿丨35B参数科学性能比肩万亿参数模型,『书生』科学大模型Intern-S2-Preview开源

5月15日,上海AI实验室开源新一代大模型预览版Intern - S2 - Preview,参数35B,多领域比肩万亿参数模型。它深化与昇腾算力生态协同,探索‘通专融合’,强化科学及智能体能力,‘算法 - 系统 - 算力’协同提升训推效率。

Hugging Face