「自适应推理框架」共找到 3380 篇相关文章
拒绝Reward Hacking!港科联合快手可灵提出高效强化学习后训练扩散模型新范式
使用强化学习微调扩散模型时,常面临Reward Hacking和KL正则化阻碍探索收敛的问题。港科等团队提出GARDO框架,通过门控自适应正则化和多样性感知优化,解决痛点且全面开源。
上交大智能计算研究院论文:不只算对答案,大模型如何真正学会运筹建模丨ICLR 2026
上海交大智能计算研究院提出 StepORLM,通过生成式过程监督提升运筹建模可靠性。研究反思传统训练范式局限,在多数据集测试中,小参数的 StepORLM 表现超大型模型,还分析现有方法缺陷并提出解决框架,有重要方法论和应用意义。
先解行为,再训Agent:CMU开源首份Agentic Search日志数据,把Agent拆开给你看
CMU团队基于DeepResearchGym平台,从半年真实流量中整理出数据,构建并在Hugging Face开源首个Agentic Search行为日志数据集。还提出三层分析框架,刻画智能体搜索行为,为研究和系统设计提供基础与信号。
ACL 2025 | 清华&港中文提出 MorphMark:全新理论视角破解大模型水印效力与文本质量的两难困境
随着大模型广泛应用,AI 生成内容追溯和版权保护成问题,现有水印技术面临效力与文本质量的矛盾。清华和港中文团队提出 MorphMark 自适应水印框架,动态调强度,在多模型实验中表现优。
基于闪电注意力机制,创新高效开源大模型
传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。
告别「一条路走到黑」:通过自我纠错,打造更聪明的Search Agent
为解决知识实时性和推理复杂性挑战,搜索智能体(Search Agent)应运而生,但缺乏自我纠错能力。腾讯联合清华提出 ReSeek 框架,引入动态自我修正机制,还构建 FictionalHot 数据集评估,实验效果良好。
内存直降50%,token需求少56%!用视觉方式处理长文本
在NeurIPS 2025论文中,南京理工大学等校研究团队提出VIST框架,为大语言模型长文本高效推理提供视觉解决方案。它模仿人类阅读机制,让模型具备选择性阅读能力,减少Token需求和内存使用。
Day0迁移、一键部署,华为开源的昇思MindSpore成为大模型开发的“万能钥匙”
在大模型无法一统天下的背景下,开发者面临在一个框架、生态体验众多主流大模型和AI技术的难题。华为开源的昇思MindSpore可实现训练Day0迁移、推理一键部署,还介绍了其相关技术和实测效果。
GPT-6要「活」了?MIT新作曝光,AI「自进化」不远了
麻省理工学院推出全新自适应大模型框架「SEAL」,让模型从「被动学习者」变为「主动进化者」。网友猜测GPT - 6可能整合其能力,成为能自主学习的模型,研究虽有局限,但为大模型自进化提供新路径。
一行命令,让任何软件秒变AI神器!这个GitHub项目杀疯了
AI智能体推理强但使用专业软件能力差,现有解决方案不佳。CLI - Anything自动化框架打破困境,能让AI通过命令行控制软件,为13款软件生成CLI,有7阶段流水线,多场景适用,介绍了使用方法和项目地址。