缓解方法」共找到 1611 篇相关文章

算法论文8

快手Klear团队提出CE-GPPO:通过梯度保留协调熵,解决强化学习中的熵不稳定问题

快手 Klear 语言大模型团队提出新强化学习算法 CE - GPPO,以「熵」为核心,提出梯度保留策略,重新利用裁剪外区间低概率 token 的梯度,实现策略熵的精细调控,解决强化学习中熵不稳定问题。

机器之心
算法论文8

NeurIPS 2025 Spotlight | 条件表征学习:一步对齐表征与准则

文章指出传统表征学习处理图片和商品信息时存在局限,针对性有监督训练成本高,多模态大模型使用成本也需考虑。为此提出即插即用的条件表征学习方法 CRL,实验显示其在下游任务表现优异。

机器之心
算法论文8

告别微调!腾讯提出Training-Free GRPO:无需更新参数,还能保证泛化性,成为传统RL的有力替代

大型语言模型在专业领域表现不佳,传统微调方法成本高、易过拟合。腾讯优图实验室提出Training - Free GRPO,无需更新参数,通过上下文学习提升性能,成本低且泛化性好,是传统强化学习有力替代。

深度学习自然语言处理
推荐文章7

Anthropic:怎么才能控制模型的行为,做好Agents?

Anthropic发关于AI Agents博客,围绕如何配置上下文让模型输出期望行为展开。指出上下文是有限资源,有Context Rot现象,介绍了上下文工程概念、构成,还提及即时策略、长时间任务处理方法及实践建议。

探索AGI
算法论文8

NeurIPS 2025 Spotlight | 只需一条演示,DexFlyWheel框架让机器人学会「自我造数据」

北京大学、哈工大联合 PsiBot 灵初智能提出 DexFlyWheel 框架,仅需单条演示就能自动生成多样化灵巧操作数据,缓解数据稀缺问题,已被 NeurIPS 2025 接受。此框架在成本、效率和数据多样性上优势明显。

机器之心
算法论文8

超越RAG,DRAG让LLM准确率飙升45.5%,问题越复杂能力越强

RAG技术虽能让LLM检索资料生成答案,但存在短板,听不懂话里有话。DRAG方法应运而生,有DRA和RSC两大法宝,经对比实验,它在多任务上领先,准确率大幅提升,计算开销小。

AIGC开放社区
算法论文8

一举击败Claude Code!微软提出代码生成黑科技:一键直出36K行代码

现有方法依赖自然语言规划生成仓库易失效,微软提出Repository Planning Graph (RPG),以图谱替代文字规划。基于此的ZeroRepo框架能让仓库生成可控、可扩、可验证,在新基准RepoCraft上表现远超Claude Code。

新智元
开源动态7

国产开源大模型:再见9月,你好10月~

9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。

PaperAgent
开源动态8

给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集

随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。

机器之心
开源动态8

对抗协作+原型学习!深北莫FedPall开源,联邦学习破局特征漂移,准确率登顶SOTA

深圳北理莫斯科大学人工智能研究院在ICCV发表FedPall算法,结合原型对比与对抗协作学习,在多种特征偏移数据集获SOTA性能。该算法通过多步骤训练缓解特征漂移,在多个公开数据集表现出色。

机器之心