「上下文强化学习」共找到 2081 篇相关文章
DeepSeek Harness背后的“心脏”:Cordis 到底是什么
文章介绍Cordis框架,它原服务第三方QQ机器人,现是DeepSeek Harness心脏。阐述其设计初衷、核心机制,如插件、上下文等概念,还提及在DSH中的应用,展示了插件槽位和生态,最后介绍相关论文和该框架的生态情况。
拒绝视频生成,深度跃迁提出具身基座模型全新路线
深度跃迁发布世界动作模型 DELE - w0.5,放弃基于视频生成模型的路线,训练时联合学习动作与未来世界表征,推理时移除该表征分支。在真机实验中表现超基线,具跨背景泛化能力,为世界模型提供新思路。
曝GPT-5.5用上「全球最快芯片」,Claude慌了!
新智元报道,OpenAI的GPT - 5.3 - Codex - Spark用Cerebras的WSE - 3芯片达2000 token/秒。Cerebras CFO称在跑GPT - 5.4和GPT - 5.5,但SemiAnalysis报告指出其跑大模型有短板,且公开云模型小、上下文短。
和Anthropic CEO一起发过Nature,他用Claude Code复活三年烂尾代码
华盛顿大学首席开发者Brendan MacLean用Claude Code复活三年烂尾代码。他像带实习生一样带Claude,构建上下文让其理解代码库。同一周OpenAI开源Symphony,实现任务自动派Agent。二者路线不同但目的相同,都在探索让AI融入工程流程。
全网最强万字解读:DeepSeek-V4 掀翻了谁的桌子? | GAIR live 030
文章深度解读了DeepSeek-V4,从产业、生态和架构维度拆解其效率账本。它成本低,补齐短板适配昇腾芯片,但极致省钱也有代价,如性能衰减、架构复杂等。还探讨了长上下文、MoE与稠密模型路线差异及商业化潜力。
三年时间市值翻了25倍,广告新巨头AppLovin任命了一名华人CTO
在Google和Meta“垄断”的广告领域,AppLovin成为新巨头。新任CTO葛小川分享工程数据,该公司基于机器学习的广告竞价系统日处理超1000亿次请求,核心工程团队不到100人。文章讲述其发展历程、技术突破及未来规划。
“同事.skill”不用写了,爱马仕 Hermes 主动“蒸馏”你,还让开发者集体抛弃 “龙虾”?!
近日,Hermes Agent 在国内爆火,获超 3.9 万 stars。它是单 Agent 架构,核心是学习循环,记忆分层管理。其网关功能强大,状态可跨会话留存。背后的 Nous Research 目标是打造抗衡 OpenAI 的开源模型,还引入区块链解决算力问题。
AI Agent 记忆系统:从短期到长期的技术架构与实践
随着 AI Agent 应用发展,记忆系统成为构建实用 AI Agent 系统的关键技术。文章介绍了记忆基础概念、Agent 框架集成记忆系统的架构,阐述了短期记忆的上下文工程策略和长期记忆技术架构及集成,还分析了行业趋势与产品对比。
30人团队震撼英伟达!Jim Fan自曝三个教训,重押世界模型
英伟达Jim Fan带队创立GEAR实验室,30人团队产出惊人,涵盖机器人学习完整技术栈。团队有GR00T基础模型等成果,Jim Fan还分享三个教训,重注视频世界模型,提出仿真世界三阶段,指出物理AI未来是新基础设施。
大模型最难的AI Infra,用Vibe Coding搞定
Andrej Karpathy 力荐的 Vibe Coding 在 AI Infra 开发中常「水土不服」,存在上下文丢失、决策偏离、质量不稳定等问题。文章提出文本驱动的 Vibe Coding 方法,并以 Agentic RL 中的资源调度系统为例验证其有效性,还介绍了相关团队和工具。