「全栈架构」共找到 3528 篇相关文章
大语言模型高考数学拿高分靠强化学习,那文科考高分得靠什么?
大语言模型在高考数学拿高分靠强化学习,但文科题无标准答案,此方法行不通。豆包1.6系列高考文科全科获683分,靠训练数据、思维链、长上下文和多模态直接读图等因素。
扩散语言模型九倍推理加速!上海交大:KV Cache并非自回归模型的专属技巧
上海交通大学EPIC Lab团队提出免训练推理缓存机制dLLM - Cache,复用特征降低计算量。它即插即用,通用于主流dLLM架构,在多个基准测试中实现数倍推理加速,且不降低生成质量。
盘一盘,2017年Transformer之后,LLM领域的重要论文
本文梳理2017年Transformer后LLM领域重要论文。如提出Transformer架构的论文成现代AI基石;介绍GPT - 3的论文确立‘大模型 + 大数据’缩放定律,引领LLM军备竞赛等。还列举各论文内容与影响。
Ruby on Rails 之父 DHH 预言:未来“写代码”会变成不合时宜的念头!
文章介绍‘氛围编程’概念,腾讯入局推出CodeBuddy。开发者分享用此变现路径。Ruby on Rails之父DHH赞赏AI辅助,但反对全外包。网友看法不一,这场讨论揭示AI在编程中角色的核心命题。
星标超 29 万,OpenClaw 两天两次大更!适配GPT 5.4,告别“抽卡式 Prompt”
GitHub星标超28万的AI Agent开源项目OpenClaw,在周六与周日迎来两轮重量级更新,集中在模型能力、Agent架构、工程部署及安全机制四个方向。2026奇点智能技术大会将邀专家探讨其产业实践价值。
Shopify 经验贴:如何搞出一个生产级别可用的 AI Agent 系统?
Shopify 以 AI 助手 Sidekick 为例,分享从简单工具调用系统演变为复杂 AI Agent 平台的经验,包括架构设计、评估方法和训练技术等方面,还给出构建生产级别可用的 AI Agent 系统的四条核心建议。
Claude Code 项目初始化模板:黑客松冠军团队的生产级配置
claude-init 是 Claude Code 项目初始化模板,集成黑客松冠军团队生产级配置。有三层文档架构、9 个专用子智能体、10 条快捷指令、8 条强制规则及智能上下文管理,助开发者高效配置使用。
1000 行 Java 代码手搓 OpenAI gpt-oss 推理引擎
2025年8月OpenAI发布gpt - oss,作者受相关项目启发,用约1000行Java代码实现gpt - oss推理引擎并发布在亚马逊官方github。文章分享开发体会,介绍模型架构、Java实现、性能优化等内容。
你奶奶也能看懂:DeepSeek-OCR的秘密。
本文介绍DeepSeek-OCR,它并非普通OCR工具,而是用“上下文光学压缩”将大量文本信息转为少量视觉Token。其架构含编码器和解码器,压缩效果惊人,重新定义AI“记忆”,或改变AI认知方式。
奥特曼爆冷改口:AGI没用?MIT预测2028年降临,50%概率
我们越来越接近AGI,时间表从50年缩到5年,大佬预测2026、2028年降临。但AI在ARC测试得分0%,人类基本能力似新手。算力战已打响,AGI或需架构革命和技术集体转向。