「测试时强化学习」共找到 2992 篇相关文章
对抗协作+原型学习!深北莫FedPall开源,联邦学习破局特征漂移,准确率登顶SOTA
深圳北理莫斯科大学人工智能研究院在ICCV发表FedPall算法,结合原型对比与对抗协作学习,在多种特征偏移数据集获SOTA性能。该算法通过多步骤训练缓解特征漂移,在多个公开数据集表现出色。
大模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制
大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。
中美 NeoLab 对话:模型和 Agent 如何实现「持续学习」?
在新加坡 AGI Playground 2026 舞台上,AMI Labs 林敏和 Mind Lab Andrew Chen 深度对谈,探讨 Agent 如何将经验转化为能力、持续学习。两人对持续学习给出不同答案,还讨论记忆、学习等基础问题及解决办法。
17000字Claude 系统提示启示:Karpathy 揭秘LLM 学习缺失“第三范式”
Andrej Karpathy提出LLM学习范式缺失‘系统提示词学习’环节。他观察Claude约17000词的系统提示词,认为目前问题解决策略多靠人工写入,理想情况应通过该学习产生,这也引出诸多待明确细节和新问题。
首个Data Agent基准测试来了!2007个测试任务将数据库、PDF、视频、音频异构数据源一网打尽
南洋理工大学、新加坡国立大学与华为开源首个针对数据智能体异构混合数据分析的基准测试FDABench。它有2007个任务,覆盖多领域多数据源,独创协作框架,能测多种工作流模式的数据智能体。
AgentA/B:用AI模拟用户,真人AB测试或将成为历史
宾夕法尼亚州立大学和亚马逊合作研发AgentA/B测试框架,用大语言模型生成虚拟用户模拟真实行为,成本低、速度快,还能绕开真实流量测试。虽有人质疑,但它或改变传统AB测试。
构建会思考的测试Agent:从自动化到自主智能的演进
文章介绍面向企业级软件测试的质量数字人系统,结合大语言模型等实现从传统到自主智能测试跨越。分析专有云测试困境,指出通用AI Agent平台局限,阐述系统设计、能力及架构,展示应用成果并展望扩展场景与未来计划。
吴恩达来信:Agentic编程与Agentic软件测试协同合作
在人工智能辅助编程时代,自主代理编程系统虽加快开发速度,但存在不稳定性。自主测试可对比代码与测试,对软件基础设施组件测试有益。吴恩达分享编程智能体问题及测试重点领域。
强化学习也遇到了“天花板”?Andrej Karpathy构建了一个新算法
大神Karpathy肯定强化学习(RL)价值,指出其比监督微调更具扩展性,但存在渐进式学习低效、背离人类学习机制的局限。他提出“第二天性”新范式算法,还面临泛化等挑战。
清华开源一批「学习虾」,免费的「AI 私教团」来了
清华大学开源全球首个多智能体生成式学习AI技术框架OpenMAIC。它能将技术文档转化为学习课堂,还能解锁多种学习解法。其前身MAIC是重要学习平台,应用不断迭代,OpenMAIC功能强大,边界不止于课堂。