「经验驱动训练」共找到 3126 篇相关文章
Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了
由前OpenAI CTO创办的Thinking Machines Lab推出的首款产品Tinker API有重大更新。取消候选名单面向所有用户,还可微调Kimi K2 Thinking,新增兼容OpenAI API接口,支持Qwen3 - VL视觉输入,降低模型训练门槛。
AI Agent如何重构企业核心系统?深度拆解Agent、多模态与组织变革的实战路径|AICon
12月19 - 20日北京举办的AICon大会,围绕AI Agent等展开探索。来自腾讯等企业的人士将分享构建智能系统经验。大会有Keynote、平行技术专场、晚场辩论等,涵盖多领域议题,为参会者带来前瞻思想盛宴。
腾讯提出“我思故我玩”Agent:LLM构建推理与规划世界模型
腾讯与武大联合发表论文提出 CEL 新型 Agent 架构,通过 LLM 驱动两阶段循环实现“思考式学习”。它能填补传统方法短板,在小游戏实验中表现出色,有可解释性等优势,但也有实验环境局限等问题。
社区供稿丨揭秘端到端文档OCR模型 POINTS-Reader
腾讯开源端到端文档OCR模型POINTS-Reader,论文被EMNLP 2025主会录取。它提出可扩展数据生成方案,具简洁、性能好、高吞吐量等特点,通过两阶段训练方案解决依赖蒸馏数据问题,在多基准测试表现佳。
没想到,最Open的开源新模型,来自小红书
向来低调的小红书昨日开源首个自研大模型 dots.llm1,它是中等规模的 MoE 模型,在较小激活量下性能良好。其开源力度堪称行业最大,还介绍了数据处理、训练优化等多方面技术细节。
AgentScope 正式发布 Skills 支持 - 实现渐进式披露
文章指出大语言模型驱动的Agent系统存在核心矛盾,常见上下文加载方案有局限,缺乏灵活机制。介绍了AgentScope发布的Skill机制及渐进式披露策略,还讲了其在Java中的实现,最后分析了适用与不适用场景。
14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1
如今的大语言模型推理能力关键在于测试时扩展,但长思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。
200行python代码实现从Bigram模型到LLM
本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。
突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力
多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。
震惊海外开发者!BOSS直聘3B小模型比肩80B,怎么做到的?
BOSS直聘楠北阁团队发布3B轻量端侧小模型Nanbeige4.1-3B,性能震惊海外开发者。团队从多方面改进,如优化推理和偏好对齐,重构训练数据,采用多种强化学习算法,使其性能比肩大模型。