「共享基座架构」共找到 2075 篇相关文章
大模型开发者必读!拆解世界级AI模型的诞生,Hugging Face把4年模型训练经验写成了一本开源指南
Hugging Face发布《The Smol Training Playbook》,分享约4年构建SOTA模型和数据集的经验。手册涵盖是否训练、训练何种模型、如何训练等内容,强调数据质量重要性,还介绍了模型设计、训练中的实践与教训。
2025谷歌博士生奖学金揭晓,清华、科大、南大等校友入选
本周四,谷歌公布2025年度博士奖学金入围名单,获奖者来自35个国家和地区、12个研究领域,共255名博士生。文章介绍了各领域的华人研究者情况,涉及算法、架构、人机交互等多个方向。
Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成双翼齐飞
多模态AI前景广,但现有模型在理解和生成任务上存在性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,在多基准测试达SoTA水平,还展示图像编辑潜力。
LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性双丰收
LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。
The Batch: 881 | 一千万 token 的输入上下文
Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但小模型,大规模表现未知。
KV-Cache 实战策略:生产环境中的分页、固定与复用技术解析
在大语言模型推理场景中,KV - Cache 是平衡性能与成本的核心技术,但生产环境中面临诸多问题。本文聚焦其分页、固定与复用三大战术,结合原理、实践与案例,为开发者提供解决方案,还探讨了未来演进方向。
2025临界点:AI智商超越人类,经济规则即将改写
AI平均智商超110,2025年将参与经济全链条操作。AI经济浮现,具备全天候自动运行、无劳动力供给限制、或成非稀缺经济等特点,还能降低交易成本、减少非理性决策,或带来人类第三次理性化浪潮。
你和ChatGPT的私密对话正在全网裸奔!网友炸锅:我把ChatGPT当知己,它却把我隐私挂网上
近日,谷歌搜索惊现4500条ChatGPT对话,其中含大量用户深层个人信息。OpenAI称是用户主动分享致索引,将移除该功能并清理。但聊天记录仍在其他搜索引擎现身,引发网友质疑。
别等GPT-5了!普林斯顿万字综述揭秘:我们要做自进化Agents!
普林斯顿大学联合多顶尖机构发表“自进化智能体”综述,描绘AI从静态工具演变成自我学习迭代智能体的过程,拆解其进化核心维度,介绍触发进化机制的时机、修炼方式及应用方向。
Windsurf惊魂96小时!AI闪电并购战:谷歌天价挖人,Cognition逆袭接盘
7月,谷歌以翻倍薪资和24亿美金许可协议挖走Windsurf 40多位顶尖人才。周一,Cognition宣布收购其剩余资产和200来号员工。此前OpenAI收购谈崩,Windsurf还遇模型使用问题。