中训练」共找到 4195 篇相关文章

算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务表现佳,但小模型,大规模表现未知。

DeeplearningAI
开源动态8

Karpathy再放大招:8000行代码复现ChatGPT全栈,最低成本仅100美元,4小时跑完

Andrej Karpathy发布项目nanochat,是全栈式ChatGPT克隆体训练/推理流水线,代码约8000行,覆盖训练分词器、预训练等完整流程。介绍不同成本下模型表现,还回答网友关于架构、训练数据等问题。

AI寒武纪
开源动态8

首个开源多模态Deep Research智能体,超越多个闭源方案

首个开源多模态Deep Research Agent登场,整合多种工具并优化决策。其WebWatcher技术方案覆盖全链路,实验在四大核心领域领先主流模型,展现复杂推理和信息检索实力。

量子位
产品应用8

AI Code赛道跑出一匹黑马:字节Doubao-Seed-Code

字节发布面向Agentic Coding任务优化的编程模型Doubao - Seed - Code。它在代码能力、生态兼容性、价格上优势明显,在实际案例表现出色,其训练体系独特,为开发者提供高性价比选择。

PaperAgent
开源动态8

腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!

腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务竞争力强,训练分三阶段,相关代码、模型等已开放。

量子位
算法论文8

只要9美元!LoRA+强化学习,DeepSeek 1.5B推理性能暴涨20%

南加州大学团队基于LoRA的强化学习训练1.5B推理模型,在AIME 24测试上性能提升超20%,成本仅9美元。开源Tina模型结合三大关键技术,与SOTA模型相比竞争力强,研究者还对其有效性提出假设。

新智元
新闻资讯7

OpenAI公告正经解释:为什么GPT-5.5爱说“哥布林”

OpenAI官网发公告回应GPT-5.5爱说“哥布林”问题。原来是对“书呆子”人格训练时,无意对使用生物比喻的模型给予高奖励,导致“哥布林”表述扩散。之后移除相关奖励和过滤数据来解决。

量子位
产品应用8

MiniMax都在用!5500PB幕后功臣首次亮相,国产黑马祭出杀招

AI浪潮,数据流不动致GPU算力空转,XSKY星辰天合举办AIMesh产品战略发布会破局。AIMesh含三网,分别解决IO墙、重力墙、内存墙问题,且开放解耦,获多方认可。

新智元
算法论文8

80万条数据揭示隐患:AI正在「污染」病历,你的诊疗数据可能越来越不靠谱

新加坡国立大学等机构团队研究显示,AI生成临床文本用于训练新模型,会使病理信息在数据迭代消失,降低医疗AI诊断可靠性。研究分析80多万条合成数据,还提出缓解方法。

机器之心
开源动态8

为训推加速!全新FlashQLA注意力算子库开源

自Qwen3-Next发布,GDN成Qwen主力注意力层,随模型规模扩大开销增大。现开源FlashQLA算子库,融合优化GDN Chunked Prefill前反向算子,在NVIDIA Hopper上多场景加速,提升预训练和端侧推理效率。

千问大模型