「联邦学习算法」共找到 1819 篇相关文章
社区供稿丨如何抑制大模型的“过度反思”:Yuan3.0 Flash 中的强化学习范式
大模型在企业落地时存在“过度反思”问题,浪费算力。YuanLab.ai团队在Yuan3.0 Flash模型中提出RIRM与RAPO,前者奖励“思考过程”,后者优化训练框架,实现推理效率提升,适用于企业场景。
极简主义的胜利:清华团队用最简单的强化学习配方刷新1.5B模型纪录
清华、伊利诺伊大学和上海AI实验室团队提出JustRL架构,仅用单阶段训练和固定超参数,在1.5B模型上刷新性能纪录,计算量仅为复杂方法50%,挑战了复杂技术堆叠现状。
陈丹琦新作:大模型强化学习的第三条路,8B小模型超越GPT-4o
陈丹琦团队提出结合RLHF和RLVR优点的RLMT方法,支持在基础模型上直接使用,节省后训练成本。它让模型生成CoT,用奖励模型评价输出,使小模型超越大模型,推理更像人类。
突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度
在多模态大语言模型应用多元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。
亚马逊CEO全员信曝光,硅谷AI裁员潮已至!年薪50万湾区HR被算法淘汰
亚马逊CEO全员信曝光,证实硅谷AI裁员潮来临。如45岁湾区HR、年薪15万美元全栈工程师被裁,谷歌鼓励员工自愿「买断」,2025届大学生就业也因AI变艰难。
OpenAI 早期董事会成员:算法与神经网络成“超能架构”,我们如何自处?|文末赠书
OpenAI 早期投资人里德·霍夫曼新书《AI 赋能》中文版推出。书中提出 AI 应是放大人类行动力的工具,还阐述“超级能动性”概念,强调技术与人类深度共生,批判盲目创新,主张技术锚定人文价值。
不用递归自动微分,也能稳定计算高阶 PDE 导数? Mollifier Layers 如何改造 PDE 反问题学习
本文介绍《Mollifier Layers: Enabling Efficient High-Order Derivatives in Inverse PDE Learning》,指出传统PINN递归自动微分计算高阶PDE导数有瓶颈,Mollifier Layers用解析卷积替代,实验显示其在精度、效率上有优势,也有核选择等局限。
Uber Hive 联邦架构:1.6 万数据集、10PB 数据去中心化,支撑大规模分析零停机
Uber重新设计Hive数据仓库,将超16000个数据集、超10PB数据去中心化部署,解决可扩展性等挑战。采用基于指针方案迁移,系统含四大组件降低运营风险,还减少存储开销,提升生态弹性。
通用LLM压缩算法,居然藏视频编码里!2.5bit实现4bit性能,硬件无缝支持
LLM.265研究发现,视频编码器是高效的大模型张量编码器,现成视频编解码硬件压缩AI模型数据效率高。它灵活控制码率、可压缩多种张量,还能利用GPU硬件加速。实验显示其压缩效果显著。
三重Reward驱动的运维智能体进化:多智能体、上下文工程与强化学习的融合实践
文章阐述了AI原生时代下,面向技术风险领域的智能体系统(DeRisk)的架构设计、核心理念等。介绍运维智能体发展现状,提出其技术演进需找三类Reward,还介绍相关概念、DeRisk架构,给出实践案例并将开源技术产品。