「架构选择」共找到 2137 篇相关文章
三重Reward驱动的运维智能体进化:多智能体、上下文工程与强化学习的融合实践
文章阐述了AI原生时代下,面向技术风险领域的智能体系统(DeRisk)的架构设计、核心理念等。介绍运维智能体发展现状,提出其技术演进需找三类Reward,还介绍相关概念、DeRisk架构,给出实践案例并将开源技术产品。
智谱新模型也用DeepSeek的MLA,苹果M5就能跑
智谱AI上市后发布新成果,开源轻量级大语言模型GLM-4.7-Flash,API免费开放调用。该模型是30B总参数、3B激活参数的MoE架构,定位为“本地编程与智能体助手”,评测表现佳,采用MLA架构,多平台支持。
万亿思考模型新速度!蚂蚁开源Ring-2.5-1T:IMO金牌水平,强;混合线性架构,快!
蚂蚁集团发布全球首个开源混合线性架构万亿参数模型Ring - 2.5 - 1T,打破深度思考牺牲推理速度和显存的‘不可能三角’。还同期发布扩散语言模型LLaDA2.1和全模态大模型Ming - flash - omni - 2.0,想做成可复用底座。
不靠海量数据,如何精准喂养大模型?上交Data Whisperer:免训练数据选择法,10%数据逼近全量效果
上海交通大学等团队提出 Data Whisperer,首个免训练的注意力驱动数据选择框架。它利用模型自身能力打分挑数据,无需训练与人工标注,用 10% 数据让微调效果逼近全量数据,在多方面领先传统方法。
8.8k星星!开源的211个专家级Agent,一键接入,一个人就是一个团队
今天推荐agency-agents-zh库,它是agency-agents深度汉化版,有211个精选Agent,适配国内生态。需注意,skill并非越多越好,按需选择,避免浪费资源和输出无效结果。
ClawdBot传疯了!视频教程来了
外网疯传的ClawdBot由开发者Peter Steinberger开发,能通过多平台交互干活。介绍其技术架构、两种设置方式、成本,还有安全设置、测试方法、进阶功能、使用场景及硬件选择等。
教你构建私有 AI Coding 平台:Pi、DSH、Codex Harness 扩展能力对比与选型。
文章聚焦构建私有AI Coding平台,对比Pi、DeepSeek Harness、Codex Harness的架构、扩展能力及选型策略。介绍三者交互集成方式,分析其扩展特点,并为不同需求团队给出选择建议。
kimi K3超大杯升级背后的技术内幕
文章介绍开源模型 K3 架构设计思路。主要探讨 MoE 和 MLA 部分,在 MoE 方面提出 SiTU、Norm、QB 改进;在注意力机制选择 MLA,与 KDA 混合缓解部分问题,还谈及 DSV4、NoPE 相关特点。
Qoder 发布首个自进化的智能体:看 Quest 如何重构了 Quest
Qoder 发布首个自进化智能体 Quest,它能自主完成重构自身长程任务执行逻辑等任务。Quest 从上下文管理、工具选择、Agent Loop 三方面优化架构,还具备自主进化能力,正探索自主编程新可能。
去掉 VAE 之后,商汤用 8B 参数重新定义了开源生图的上限
商汤SenseNova U1开源后引发开发者社区关注,它基于NEO - unify架构,摒弃VAE,实现多模态理解与生成原生统一。在多项基准测试中表现出色,还针对企业办公场景优化,成为生产级任务新选择。