Sub Agent架构」共找到 4220 篇相关文章

开源动态8

大模型开发者必读!拆解世界级AI模型的诞生,Hugging Face把4年模型训练经验写成了一本开源指南

Hugging Face发布《The Smol Training Playbook》,分享约4年构建SOTA模型和数据集的经验。手册涵盖是否训练、训练何种模型、如何训练等内容,强调数据质量重要性,还介绍了模型设计、训练中的实践与教训。

AIGC开放社区
新闻资讯7

2025谷歌博士生奖学金揭晓,清华、科大、南大等校友入选

本周四,谷歌公布2025年度博士奖学金入围名单,获奖者来自35个国家和地区、12个研究领域,共255名博士生。文章介绍了各领域的华人研究者情况,涉及算法、架构、人机交互等多个方向。

机器之心
算法论文8

Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成双翼齐飞

多模态AI前景广,但现有模型在理解和生成任务上存在性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,在多基准测试达SoTA水平,还展示图像编辑潜力。

深度学习自然语言处理
算法论文8

LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性双丰收

LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。

机器之心
新闻资讯7

阿里云容器服务覆盖AI全流程,团队透露:OpenAI训练GPT时就用了我们的开源能力

拿下中国AI云市场第一后,阿里云技术产品负责人开展AI Infra分享会。其全栈云计算搭好技术架子,10万GPU集群高效互联,容器服务贯穿AI全流程,还透露OpenAI训练GPT时用了其开源能力。

量子位
算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但小模型,大规模表现未知。

DeeplearningAI
推荐文章8

KV-Cache 实战策略:生产环境中的分页、固定与复用技术解析

在大语言模型推理场景中,KV - Cache 是平衡性能与成本的核心技术,但生产环境中面临诸多问题。本文聚焦其分页、固定与复用三大战术,结合原理、实践与案例,为开发者提供解决方案,还探讨了未来演进方向。

CourseAI
产品应用8

Claude官方即将推出Chrome浏览器插件,可能....其它所有的AI浏览器插件都会死。

Claude官方即将推出Chrome浏览器插件,现正进行小范围测试。它功能强大,能在侧边栏操作页面,还能处理日程、邮件等工作。相比多数插件,它安全性高,或让仅能总结摘要的插件被淘汰。

开源AI项目落地
推荐文章8

每个token都在亏钱,但ARR9个月破亿!从烧光现金、裁掉一半员工到反杀Cursor,Replit CEO曝一年内如何极限翻盘

2024年初到2025年9个月内,Replit的ARR从不到1000万美元突破1亿美元。其增长基于系统性战略,从基础设施整合发力。创始人分享发展历程,还谈到AI编程趋势及产品边界等内容。

AI前线
推荐文章7

2025 年中丨大模型市场分析报告

这是《2025年中丨大模型市场分析报告》。指出基础大模型塑造计算未来,企业重心转向推理。Anthropic超OpenAI成市场头号玩家,开源模型采用趋缓,企业换模型重性能,AI支出从训练转向推理。

特工宇宙