循环利用」共找到 544 篇相关文章

算法论文8

首次结合RL与SFT各自优势,动态引导模型实现推理⾼效训练

新一代大型推理模型在复杂推理有进展,核心是ZERO - RL训练法。华为香港研究所小艺团队等合作推出GHPO算法框架,融合在线强化学习与模仿学习,解决了RLVR方法局限,提升模型训练效果,代码数据开源。

机器之心
开源动态7

开源DeepSeek R1增强版:推理效率快200%,创新AoE架构

德国TNG公司开源DeepSeek R1增强版DeepSeek - TNG - R1T2 - Chimera,基于三大模型混合开发,采用创新AoE架构,推理效率比R1 - 0528快200%,成本大减,在主流测试中性能更好。还介绍了AoE架构构建子模型方法。

AIGC开放社区
算法论文8

文本分类重大创新:持续学习新增类别,不会灾难遗忘

在生成环境中,传统文本分类方法新增业务标签需从头训练,易致知识灾难性遗忘。今天介绍的自适应分类器,通过四项创新,可实现动态类添加和持续学习,而不会发生灾难性遗忘。

CourseAI
新闻资讯7

The Batch:833 | 针对智能体的钓鱼攻击

研究人员发现误导基于大语言模型的自主智能体的方法,即通过在热门网站植入恶意链接,利用智能体对热门网站的‘隐性信任’攻击。测试显示智能体易受诱导执行有害行为。

DeeplearningAI
新闻资讯7

0粉丝狂卷数十亿播放,靠AI流量欺诈获利近亿!网友:这“刑”得离谱

2024年全球录制音乐市场总收入飙升,流媒体经济贡献突出,但AI技术引发的流媒体欺诈问题严峻。如北卡罗来纳州男子Michael Smith利用AI创作虚假歌曲欺诈获利,类似事件增多,平台反击成效不佳。

AI前线
推荐文章8

深入原子世界,他在寻找材料失效的原因

文章介绍了美国宾夕法尼亚州立大学副教授杨洋的材料研究。他利用先进电子显微技术,研究材料在极端环境下微观过程,如空位、虫洞腐蚀和短程有序,旨在理解材料失效机制,推动材料设计优化。

DeepTech深科技
新闻资讯7

DeepSeek涨价,OpenAI降价,Agent改写了大模型价格战

近期,DeepSeek上调API价格,V4 Pro等型号涨幅明显;而OpenAI的GPT - 5.6 Luna API价格降80%,Terra降20%。这背后是大模型价格竞争方向转变,受竞争、广告、效率及Agent使用方式等因素影响。

DeepTech深科技
新闻资讯7

上下文窗口限制被打破:Subquadratic推出了一个1200万Token的窗口

2026 年前沿模型宣传至少 100 万 Token 上下文窗口,但利用不佳。Subquadratic 推出能处理 1200 万 Token 窗口的模型,称可绕过问题,还将推 5000 万窗口模型,其 SSA 架构有优势,基准测试成绩佳。

InfoQ
开源动态7

Mythos架构被22岁小伙“逆推”开源了!MoE和注意力借鉴DeepSeek

22岁小伙Kye Gomez将Claude Mythos架构整合开源成OpenMythos,实现带MoE路由的循环深度Transformer(RDT)。该架构仅用一半参数,就能获与传统模型同等效果,吸引学界关注。

量子位
算法论文8

后训练中的RL已死?MIT新算法挑战传统后训练思维,谢赛宁转发

MIT研究人员提出RandOpt新算法,挑战传统后训练思维。该算法通过随机扰动和集成突破限制,在多任务中表现出色,揭示了预训练模型权重空间的“神经丛林”现象,引发AI社区关注。

机器之心