「循环式架构」共找到 2508 篇相关文章
英特尔连环炸:CTO被OpenAI挖走、中国区架构大调!陈立武亲自下场扛AI,称“不再提供空白支票”
近日,英特尔CTO兼AI负责人Sachin Katti离职加盟OpenAI,他负责搭建计算基础设施。此前其部门未达营收预期,英特尔多位高管出走。CEO陈立武亲自领导AI业务,还推进改革和中国区架构调整。
Kimi K2发布两天即“封神”?80%成本优势追平Claude 4、打趴“全球最强AI”,架构与DeepSeek相似!
国内独角兽月之暗面发布并开源 Kimi K2 模型,推出两天就在 OpenRouter 平台 token 使用量超 xAI 的 Grok 4。它成本低、性能强,编码能力追平 Claude 4,架构与 DeepSeek 相似,技术研究也多次‘撞车’。
LLM工业级自进化:北邮与腾讯AI Lab提出MoE-CL架构,解决大模型持续学习核心痛点
北邮百家AI团队与腾讯AILab提出MoE - CL架构用于LLM自进化持续指令微调。其结合‘解耦LoRA专家’与‘GAN对抗降噪’,在腾讯业务及基准测试中效果佳,降低人工成本,准确率优于主流方法。
刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%
月之暗面推出全新注意力架构Kimi Linear,有望成下一代Agent LLM基石技术。它解决了LLMs处理长序列任务的瓶颈,性能超传统机制,还开源了核心代码。Kimi Linear的KDA模块提升了表达和硬件效率,实验表现佳。
微软亚洲研究院机器学习组首席研究员刘炜清确认出席 AICon 深圳,分享由生成式基础模型驱动的金融市场仿真引擎
8月22 - 23日,首届AICon全球人工智能开发与应用大会深圳站将启。微软亚洲研究院刘炜清等专家将分享经验。刘炜清会介绍由生成式基础模型驱动的金融市场仿真引擎MarS,展示其在金融场景潜力。
社区供稿 | Hugging Face x 北京中关村学院等机构联合发布生成式基因组大模型Carbon:一场关于“生命语言”的范式革命
北京中关村学院等联合发布生成式基因组大模型Carbon并开源。Carbon家族有三个版本,旗舰模型Carbon - 3B在多任务匹敌70亿参数的Evo2 - 7B,运行速度快275倍。它在数据、分词、训练上有创新,还实现技术普惠,有多种应用场景。
Pixeltable:一张表搞定AI流水线
Pixeltable是统一声明式框架,能处理多模态AI流水线。它用表格接口替代传统复杂架构,有数据统一管理等核心能力,适用于多模态RAG等场景,内置支持主流AI服务,值得多模态AI项目一试。
PD 分离推理的加速大招,百度智能云网络基础设施和通信组件的优化实践
为适应PD分离式推理部署架构,百度智能云从物理网络、网络流量、通信组件和算子层面优化,提升上层推理服务性能,展现了网络、组件与业务特征融合的重要性。
推荐大模型来了?OneRec论文解读:端到端训练如何同时吃掉效果与成本
随着AI发展,推荐系统面临诸多问题,快手技术团队提出OneRec,以端到端生成式架构重构推荐系统全链路,在效果与成本上实现突破,已在快手双端服务用户,也有需完善之处。
Qwen3家族训练秘籍公开:思考/非思考融进一个模型,大模型蒸馏带动小模型
Qwen3技术报告揭晓8款模型关键技术,采用双模式架构,训练和微调分段进行,还“大带小”蒸馏数据。其融合思考与非思考模式,训练分多阶段,Qwen Chat还全量上线深度研究功能。