「参数知识迁移」共找到 1396 篇相关文章
OpenAI 内部是怎么使用 Codex 的.pdf
文章基于对 OpenAI 工程师的采访和内部使用数据,汇总了 Codex 在 OpenAI 内部的使用案例和最佳实践。展示其在代码理解、重构迁移等七大场景的应用,还给出使用的最佳实践,认为未来潜力大。
对话RoboScience邵林:VLOA大模型如何突破具身智能泛化瓶颈
本文对话RoboScience联合创始人邵林,探讨VLOA大模型突破具身智能泛化瓶颈。他介绍了模型优势、设计思路,对比VLA,还谈及范式、难点及落地场景等,强调以人中心、做有温度技术,重视模型落地。
AI 基础知识从 0.6 到 0.7—— 彻底拆解深度神经网络训练的五大核心步骤
文章以 PyTorch 手写数字识别代码为引,深入剖析深度神经网络训练的五大核心步骤,涵盖前向传播、计算损失、反向传播、更新参数和循环训练,还介绍激活函数、Dropout 等概念及正则化、优化器等技术。
Kimi K2 详测|超强代码和Agent 能力!内附Claude Code邪修教程
作者熬夜带来 Kimi K2 模型详测及 CC+K2 邪修教程。K2 是 1T 参数量的 MoE 开源模型,基准测试成绩优异,在代码、Agent、数学推理任务表现突出,前端能力强,还能驱动 Claude Code,成本低。
KAG-Thinker:「结构化」思考新范式,支持逻辑严谨的大模型复杂推理
近日,蚂蚁集团知识引擎团队协同高校发布 KAG-Thinker 模型,是 KAG 框架重要迭代。它聚焦复杂推理,建立结构化思考范式,实验显示其性能在多数据集上有提升,还在医疗问答验证了专业领域有效性。
苹果港大终结自回归时代?7B扩散模型发布,AI写代码逻辑彻底颠覆!
苹果联合港大开源扩散大语言模型DiffuCoder,用扩散模型+强化学习策略,性能提升4.4%。研究还提出耦合梯度奖励策略优化方法,建立原生RL训练框架,探究了dLLM的生成机制等问题。
Mistral的首个强推理模型:拥抱开源,推理速度快10倍
本周二,欧洲人工智能公司 Mistral AI 发布全新大语言模型 Magistral 系列,有企业版 Magistral Medium 和 24B 参数开源版 Magistral Small。它推理强、多语言表现好,速度比竞品快 10 倍,应用于主流云平台,成本有竞争力。
别再卷数据了,LLM也怕「过劳死」!CMU等揭秘灾难性过度训练
CMU、斯坦福等四大名校研究团队挑战“预训练规模越大越好”观点,提出“灾难性过度训练”现象,即增加预训练数据可能导致后训练性能下降,并从现实证据、控制实验、理论分析等方面阐述新研究贡献,还介绍了相关实验及结论。
打通AI4S数据入口:MinerU.Chem让化学文献中的“图片”,从“人类可读”走向“AI可用”
上海人工智能实验室 OpenDataLab 团队发布 MinerU.Chem 技术报告及成果,升级化学文献智能解析能力。它能将化学文献图片转化为 AI 可用数据,解决化学知识机器难用问题,在评测中领先,还将助力 AI4S 发展。
姚顺雨Agent能力交卷!腾讯混元Hy3把元宝练成了打工人
腾讯混元Hy3正式版发布,总参数295B、激活参数21B,最大支持256K上下文。它是快慢思考融合的MoE模型,重点提升Coding和Agent能力。其加持下,元宝大升级,能完成办公、生活等多场景任务。