「预训练策略」共找到 2842 篇相关文章
大模型“拼好题”,45K数据撬动18%提升,数学问题拒绝死记硬背 | MathFusion
上海AI Lab等团队提出MathFusion,通过三种“融合策略”生成新的融合数据集MathFusionQA,仅用45K合成指令,在多基准测试中平均准确率提升18.0个百分点,增强模型解决数学问题的能力。
年度AI论文!全球三大顶尖模型的防蒸馏机制全面告破:小模型“套出”大模型隐藏思维链,Kimi-K3重现概率异常
这篇论文指出三大前沿AI模型厂商API有密码学旁路漏洞,攻击者用轻量级模型就能恢复大模型隐藏思维链数据。还揭示部分模型训练或借鉴大模型思维链,此漏洞也致企业数据隐私安全问题。
回村拜年、赶集舞狮:一台小机器人的县城奇幻漂流|甲子光年
2026马年春节,人形机器人迎来高光。‘清华系’加速进化公司将小型人形机器人Booster K1带回乡村,在多样场景测试。该公司走小而美路径,产品性能优、销量好,通过B端、C端策略打开市场。
强化学习+MCP=王炸?开源框架教AI在MCP中玩转工具解决任务,实测效果超越GPT!
科技公司OpenPipe提出全新开源强化学习框架MCP·RL,只需一个MCP Server地址,agent就能自动发现工具、生成任务,在闭环反馈中摸索出最优调用策略,实测在2/3的benchmark上达或超SOTA性能。
图解Vllm V1系列6:KVCacheManager与PrefixCaching
文章聚焦vllm v1,阐述调度器取请求时判断设备有无充足空间做推理的问题,涉及KVCacheManager与Prefix Caching。前者管理请求和块,后者通过找最长一致前缀节省显存,还介绍块分配释放策略与流程。
马斯克「世界模拟器」首曝,1天蒸馏人类500年驾驶经验!擎天柱同脑进化
特斯拉官宣「世界模拟器」,可模拟、合成自动驾驶的「孪生世界」,生成不同视角和长尾场景。它基于端到端神经网络,有学习人类价值观等优势。还能用海量数据解决难题,输出可解释中间结果,为自动驾驶和擎天柱训练服务。
从打分器到思考者:RM-R1用推理重塑模型价值判断
伊利诺伊大学香槟分校团队提出 RM - R1 框架,将奖励建模定义为推理任务。它引入推理奖励模型和链式评估准则机制,经两阶段训练,在多基准测试中表现超大规模模型,验证了推理能力对奖励模型的重要性。
Cursor发布Composer 2:专攻代码的模型,价格只有GPT-5的零头
Cursor本周发布自研编程模型Composer 2,只攻代码生成。其得分提升,超Claude Opus 4.6,接近GPT - 5.4 Thinking。训练基于代码数据,处理复杂编程任务准确度高,价格远低于竞品。这是Cursor全栈布局,欲掌握AI编程主动权。
王兴一鸣惊人!美团首个开源大模型追平DeepSeek-V3.1
美团首个开源大模型Longcat-Flash-Chat发布即引发热议。它在部分benchmark上超DeepSeek-V3.1等,编程能力也出色。技术报告透露美团对大模型的理解,还有新发现,且性能好、训练效率高。
刚刚,Kimi K3开源!3万亿模型权重全球开放
2026年7月27日,Moonshot AI开源全球首个3万亿参数级模型Kimi K3。它不仅参数量大,还在多领域表现出色,能与顶尖闭源模型媲美。其架构创新、训练独特、推理成本低,有望改变全球大模型格局。