「合成持续训练」共找到 2616 篇相关文章
最近新出现的两个提示词注入攻击场景
随着AI应用广泛,提示词注入攻击场景增多。一是Checkpoint发现带注入攻击的恶意软件,与AI分析系统对抗;二是多所大学论文含面向AI的秘密指令,对抗AI审稿。本质是攻防双方的对抗,且会持续。
Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了
由前OpenAI CTO创办的Thinking Machines Lab推出的首款产品Tinker API有重大更新。取消候选名单面向所有用户,还可微调Kimi K2 Thinking,新增兼容OpenAI API接口,支持Qwen3 - VL视觉输入,降低模型训练门槛。
没想到,最Open的开源新模型,来自小红书
向来低调的小红书昨日开源首个自研大模型 dots.llm1,它是中等规模的 MoE 模型,在较小激活量下性能良好。其开源力度堪称行业最大,还介绍了数据处理、训练优化等多方面技术细节。
Karpathy用「harness」彻底终结了RAG。
假期时Karpathy提出llm.wiki想法引发关注。它是元框架,定义人类与AI协作管理知识的方式。与RAG不同,它将新材料关键信息编入已有wiki并持续维护。作者用多种数据测试,发现TextIn API解析效果好,还优化处理流程提升质量。
14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1
如今的大语言模型推理能力关键在于测试时扩展,但长思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。
200行python代码实现从Bigram模型到LLM
本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。
突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力
多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。
震惊海外开发者!BOSS直聘3B小模型比肩80B,怎么做到的?
BOSS直聘楠北阁团队发布3B轻量端侧小模型Nanbeige4.1-3B,性能震惊海外开发者。团队从多方面改进,如优化推理和偏好对齐,重构训练数据,采用多种强化学习算法,使其性能比肩大模型。
腾讯LLM团队:对下一个 Token 预测的深入剖析,多样性 or 精准度?
最新研究证实RL能增强LLM推理,但成效受限预训练token分布。腾讯LLM部把交叉熵重写成单步策略梯度,用超参压熵,为RL打造‘低熵高信号’起点,经实验验证低熵模型优势明显。
4倍速吊打Cursor新模型!英伟达数千GB200堆出的SWE-1.5,圆了Devin的梦!实测被曝性能“滑铁卢”?
Cognition推出全新AI编码模型SWE-1.5,专为软件工程任务设计,运行速度快,在基准测试中成绩良好。它基于GB200芯片训练,有定制编码环境,开发有新战略,还与Cursor新模型Composer对比引发关注。