「自我优化框架」共找到 2888 篇相关文章
狂涨20.8K star!GitHub 官方出品,强烈推荐!
介绍开源项目 `GitHub Desktop`,它基于Electron开发,用TypeScript编写并使用React框架,支持Windows和Mac,集成常用Git操作,有直观图形界面等特色,助开发者轻松使用Git,目前获20.8K star。
百度Qianfan-VL,发票/图表/合同等PDF识别94.75%刷新纪录!
当前主流视觉 - 语言模型在企业级应用有难点,百度千帆团队提出Qianfan - VL系列多模态大模型,在通用和企业级任务表现出色,基于自研芯片训练,还提供框架与管线降低成本。
GPT-5-Codex 一手实测
OpenAI推出新编程模型GPT - 5 Codex,Every团队实测显示其表现狂野。它能动态选思考时间,可在不同开发环境无缝切换,代码审查更优。但也存在对任务挑剔、环境设置麻烦等问题。
用短视频成本生成长视频,字节Seed新注意力机制让计算量降低85%
字节Seed与斯坦福等机构推出新模型,其新注意力机制MoC能让长视频生成计算量降低85%,质量不减且保持连贯性。团队将视频生成定义为上下文检索任务,提出MoC机制并阐述实现方法。
Agent狂欢下的冷思考:为什么说Data&AI数据基础设施,才是AI时代Infra新范式
文章指出Agent成AI主流叙事,但企业部署后效果不佳,因未认识到Agent平台无法单独构成AI Infra。强调数据是AI Infra核心,提出Data&AI数据基础设施是新范式,还分析赛道玩家并介绍科杰科技的实践。
史上最大高质量科学推理后训练数据集开源,快速让Qwen3等变“科学家”
上海创智学院、上海交通大学发布开源科学推理后训练数据集MegaScience,含约125万条问答对,覆盖多学科。它解决了现有数据集的问题,实验显示能提升模型科学推理能力,已完整开源相关组件。
硬核拆解大模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构
本文详细列举 8 个主流大语言模型,硬核拆解架构设计与革新思路,介绍架构演进趋势。如 DeepSeek-V3 的 MLA 与 MoE 技术,OLMo 2 的归一化策略,Gemma 3 的滑动窗口注意力机制等。
0.016%参数撬动18%性能:关键表征微调破解LLM推理瓶颈
大语言模型在推理任务依赖思维链技术,传统PEFT方法需修改大量参数,新兴ReFT虽只需调整少量参数,但存在不足。本文提出CRFT,仅用0.016%参数量就提升性能,为轻量化推理增强开辟新路径。
创智突破:AI首次自主发现106个超越人类设计的神经网络架构
创智学院团队发布的AI超智能系统ASI - ARCH,自主发现106个超越人类设计的神经网络架构,建立“科学发现缩放定律”,实现从“自动化优化”到“自动化创新”转变,还将成果开源推动研究发展。
如何利用pytorch memory snapshot进行显存分析
文章聚焦于用pytorch memory snapshot分析模型训推显存消耗,不讨论工具使用,侧重解读记录内容。以混合精度训练为例,介绍各步骤显存管理细节,还给出单层、双层模型及zero1训练的显存分析。