在离线混部」共找到 8223 篇相关文章

算法论文8

Meta通过简单算术解锁LLM SoTA性能

大型语言模型训练耗算力与时间,传统模型融合方法有局限。本文提出SoCE新方法,通过筛选专家模型、非均匀加权平均融合,多评测中实现先进性能,为LLM优化提供新思路。

深度学习自然语言处理
产品应用7

谷歌Nano Banana 2 来了,图片AGI提前到来?

伴随Gemini 3、GPT 5.1小道消息,谷歌Nano Banana 2提前到来。它采用多步骤生成流程,有自我纠错循环,能替代部分Photoshop功能,细节、配色等方面比一代提升明显,即将正式上线。

探索AGI
开源动态8

两周复刻DeepSeek-OCR!两人小团队还原低token高压缩核心,换完解码器更实用

两人小团队仅用两周复刻DeepSeek-OCR,复刻版DeepOCR还原其低token高压缩核心优势,还关键任务上追上原版表现。它完全开源,无需大规模算力集群,训练方案适配中小团队。

量子位
算法论文8

NeurIPS 2025 | 北大联合小红书提出Uni-Instruct:ImageNet单步生图FID进入1.0时代!

北大联合小红书提出的 Uni - Instruct 框架被 NeurIPS 2025 接收,它统一超 10 种单步扩散模型蒸馏方法,多项任务达最佳性能,还能用于文本到 3D 生成。

机器之心
新闻资讯7

创新中心 | “影视AIGC实战进阶”专题活动,亮相第八届初心榜!

AIGC全面融入影视产业,重塑创作方式等。‘AIGC影视应用专题对话’作为第八届初心榜青年视听展重要环节,将首创·郎园Station举行,汇聚多领域力量探讨影视AIGC落地实践。

郎园Station
新闻资讯8

Google推出 AI 科学家:自动编写专家级代码,40个新方法碾压人类 SOTA

Google新发布的AI系统能编写科学软件、发明新方法,结合大语言模型与树搜索技术。生物信息学、流行病学等多领域超人类最优水平,引发网友对科研影响的讨论。

AGI Hunt
新闻资讯7

DeepSeek V3.1 突发离谱「极」字Bug的原因找到了~

DeepSeek V3.1被曝恶意漏洞,生成文本时会突然插入“极”字。该漏洞第三方API平台和官方Playground均有出现,可能因数据集“污染”或模型“偷懒”,严重影响高精度场景。

PaperAgent
开源动态8

SGLang 2025-8月性能优化技巧记录

本笔记记录2025年8月SGLang框架性能优化实践,涉及GPT - OSS、DeepSeek - V3等模型,采用allreduce_add_rmsnorm、量化、通信、内核融合等优化技术,性能提升、减少延迟等方面效果显著。

GiantPandaLLM
新闻资讯7

思维外包化!AI正“废掉”我们的大脑

当下“AI是否会抢走工作”讨论火热,亚马逊CEO称重复性岗位将被取代。但更危险的是,对AI过度依赖或“废掉”大脑,催生“思想懒汉”,教育领域体现尤令人担忧。

AI工程化
开源动态7

MCP实战|从0到1构建异步 DeepResearch 工具,支持进度推送与超时控制

本文借助开源项目,构建可MCP Server中异步运行的DeepResearch,支持任务进度推送与超时控制。介绍项目架构、构建步骤、任务管理器实现要点及效果测试,还提及优化方向并给出源码。

AI大模型应用实践