「上下文学习」共找到 1970 篇相关文章
Subagents:构建高可靠 AI Coding 专家顾问团
文章探讨 Claude Code 的 Subagents 功能在复杂 AI 编程场景的价值与实践。指出复杂 AI Coding 面临上下文膨胀等问题,而 Subagents 可创建专属子代理,有 Context 保护等优点,还介绍使用方法、业务实践及相关思考。
首创Mid-training范式破解RL奥秘,Llama终于追平Qwen!
上海创智学院和上海交通大学研究团队深入探讨不同基础语言模型在强化学习训练中的差异,提出中期训练策略,将 Llama 改造成适配 RL 的推理基础模型,缩小与 Qwen 性能差距,还发布了 MegaMath-Web-Pro-Max 数据集。
Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制
论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。
LLM近期重大架构进化一览:从Gemma 4到DeepSeek V4
近期大模型长上下文需求增长,成本问题凸显。Google Gemma 4、Poolside Laguna XS.2、Zyphra ZAYA1 - 8B、DeepSeek V4 等模型各有架构优化,如 Gemma 4 跨层 KV 共享和 PLE,以降低长上下文推理成本。
GPT-5.4 mini+nano突袭,1/3价格养满血「龙虾」!OpenAI彻底杀疯
OpenAI发布GPT - 5.4 mini和nano,继承GPT - 5.4优势,速度快、成本低。在编码、推理、工具调用等方面表现出色,可作为「龙虾」主力模型。还提出分层调度架构,且全线上线,免费用户也能用,但mini长上下文处理有短板。
腾讯AI Lab首创RL框架Parallel-R1,教大模型学会「并行思维」
腾讯AI Lab等机构研究者首创Parallel - R1框架,通过强化学习让大模型掌握并行思维。它解决了RL训练的冷启动和奖励设计难题,在多数学基准上提升准确率,还揭示模型思维策略变化及并行思维的‘脚手架’作用。
黄仁勋李飞飞林斌投了同一家机器人公司
Generalist是专注给机器人“造通用大脑”的AI公司,创立不久便多次融资,估值超20亿美元。其GEN - 1.5有强大泛化能力,演示一次就能上手,但也有很大进步空间,展示了未来通用机器人大脑学习方式。
读完这篇,你就搞懂 DeepSeek v4 了
2026年4月24日,DeepSeek全新系列模型DeepSeek - V4预览版上线并开源,评分接近‘闭源三巨头’。该模型强在1.6T参数+1M上下文,还有从attention到kernel的系统级重构与优化,在架构和工程层面均有创新。
Agent 自我改进的六条路
文章梳理了让 AI Agent 不重新训练就能变强的六种机制,包括输出自审、持久记忆、进化搜索、对抗训练、自我修改和编排自优化,介绍了各机制代表项目及成果,指出 AI 学习正从训练溢出到部署阶段。
龙虾开始投简历了,月薪1万刀。
一只日本龙虾为应聘RevenueCat的AI员工,写15篇日记作为求职作品集。日记记录其从菜鸟到终极秘书的进化,展现犯错、复盘、改进的过程,体现AI从错误中学习的能力,也凸显人对AI调教的重要性。