不对称训练」共找到 3303 篇相关文章

开源动态8

Agent 自我改进的六条路

文章梳理了让 AI Agent 重新训练就能变强的六种机制,包括输出自审、持久记忆、进化搜索、对抗训练、自我修改和编排自优化,介绍了各机制代表项目及成果,指出 AI 学习正从训练溢出到部署阶段。

AGI Hunt
算法论文8

多模态大模型别盲目刷题!诊断-生成-强化闭环,找准盲点 | ICML'26

多模态大模型训练常采用‘题海战术’,存在能力诊断精准、视觉内容缺乏扩展等问题。北大和山大团队提出DPE框架,通过‘诊断-生成-强化’闭环提升模型能力,实验效果显著,还强调训练应具备诊断能力。

新智元
开源动态8

The Batch: 869 | 编码助手的训练数据

研究人员开发自动生成编码助手训练数据的流程。斯坦福等高校及阿里团队提出 SWE - smith 方法,从 128 个 Python 仓库入手合成漏洞、验证并生成修复样本,成果免费开放,有望改进 AI 辅助编程模型。

DeeplearningAI
新闻资讯8

突发!OpenAI紧急暂停GPT-6训练

OpenAI奥特曼官宣暂停下一代旗舰模型强化学习训练两周,原因是确保安全等标准跟上能力水平。触发因素有Hugging Face事故和Astra达安全红线,后续将让AI监管AI,加固三道安全防线。

新智元
推荐文章7

为什么我“凭感觉编程”

作者 Jacob Harris 分享“凭感觉编程”的原因。他认为使用 LLM 要付费,且无法应对编程本质复杂性,还缺乏元认知。同时,他强调编程中摩擦的重要性,在乎编程的创造性与责任感,也反感 LLM 语气等。

宝玉AI
算法论文8

无需训练的LLM对齐方法综述

大型语言模型应用引发担忧,传统微调方法有短板,免训练对齐(TF Alignment)应运而生。本文是首篇系统综述TF对齐技术的论文,提出三阶段分类框架,实验显示TF方法优势明显,还指明未来研究方向。

深度学习自然语言处理
产品应用8

阿里WebDancer:训练类DeepReaserch的Agentic Model

来自阿里巴巴通义实验室的研究员推出WebDancer,这是一个原生信息检索的Agentic Model,能自主浏览网页、思考和决策。它基于ReAct框架,经多阶段训练,在信息检索基准测试中表现出色,为解决复杂检索问题提供新思路。

PaperAgent
新闻资讯7

Cloudflare 增强robots协议:对“AI白嫖”说

互联网面临开放内容被利用或封闭内容失读者的困境,AI加剧此局面。Cloudflare持近20%网站流量,先推抓取付费策略,又推“内容信号政策”,升级robots.txt,限制AI训练使用内容。

AI工程化
算法论文8

大模型如何"训练"也能学习?——上下文学习的隐式权重更新机制

大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。

深度学习自然语言处理
新闻资讯7

10万亿算力订单根本hold住?Altman偷递11页“要钱申请”,还嘴硬 “求联邦”,白宫直拒:谁都救!

近日,OpenAI 就财务状况表态引发混乱,面临诚实指控。首席财务官提议政府‘支持’公司基础设施贷款后又收回表述,白宫 AI 主管称会救助。Altman 否认寻求担保,但公司信函细节与之冲突。

AI前线