「互补学习系统理论」共找到 2930 篇相关文章
AI时代,为什么你又焦虑又学不进去?这个人破解了专注力的秘密
文章指出AI时代人们学不进去,原因在于信息爆炸、AI工具易致分心,本质是没学会处理学习不适。介绍了Time Boxing、“10分钟法则”等应对方法,强调专注力是新学习力,要预先规划建立学习系统。
通用AI Agent系统AI Manus
AI Manus是通用AI Agent系统,支持在沙盒环境运行工具。文中给出使用示例,介绍环境要求、部署与开发指南,推荐用Docker Compose部署,还提及项目地址、交流群等信息。
python打造Google(A2A)+MCP,Langchain生态互补
文章介绍Google的Agent2Agent(A2A)协议,它能实现AI代理通信协作,打破平台孤岛。还提及MCP协议,二者互补。重点介绍python - A2A库,它实现A2A规范,与多框架、模型集成,给出实战示例。
快手AgentX:推荐系统开始自我迭代
过去十年推荐系统核心在‘建模’与‘工程’,但日常迭代瓶颈在研发生产方式。快手 AgentX 团队提出 Agent 驱动研发闭环,在快手 App 业务部署中跑通完整闭环,提升效率与业务收益。
突发!OpenAI停止强化学习训练两周
OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。
揭示隐藏联系:RLHF/DPO即对比学习!
大型语言模型输出符合人类价值观是挑战,主流技术RLHF复杂、昂贵且不稳定,DPO简化流程但有训练崩溃问题。论文揭示RLHF/DPO即对比学习,提出MIO算法解决DPO崩溃,实验验证其性能优势。
RecGPT-阿里的LLM推荐系统落地方案
文章介绍阿里RecGPT推荐系统落地方案,包括召回和推荐可解释性两方向。召回采用三塔结构,通过挖掘用户兴趣生成商品标签提升召回多样性。还提及行为序列压缩、推荐归因等,以及大模型微调和评估方法。
什么是系统提示词?如何逆向提示词?
大语言模型启动时会接收系统提示词,决定其角色、回答风格与安全边界。提示词逆向是试图获取或绕过该提示的行为。本文介绍其作用、逆向手法及开发者防御措施,助于安全使用和设计大模型。
Anthropic 研究员:强化学习将推动 Transformer 实现 AGI
在 AI Agenda Live 纽约活动上,Anthropic 强化学习团队技术负责人 Sholto Douglas 称,无需新架构突破,强化学习能让 Transformer 达人类专家级别表现,接近 AGI。但定义「好表现」是难题,Anthropic 或投 10 亿美元提升模型企业应用表现。
变更即指标:用交付信号度量系统可靠性
系统变更是生产事故主因,本文提出聚焦变更可观测性的指标框架,介绍可扩展架构采集展示指标。定义业务和技术指标,构建以事件为中心架构获取数据,还阐述以数据驱动改进变更交付过程。