大模型新架构」共找到 9812 篇相关文章

开源动态8

6.1B激活,三榜开源第一!蚂蚁·安诊儿医疗模型发布

由浙江省卫生健康信息中心等联合研发的开源医疗语言模型AntAngelMed发布。它基于Ling - flash - 2.0,100B总参数仅激活6.1B达约40B密集模型性能,在多个权威医疗基准测评中居前列,采用三阶段训练流程,高效MoE架构

AIGC开放社区
产品应用8

Kubernetes环境中作业帮模型服务流量调度优化实践

随着语言模型应用渐广,Kubernetes 现有 Ingress 组件在模型服务流量管理上有局限。作业帮提出创新调度方案,整合成模型网关,具备五项核心功能,提升了资源效率、稳定性和易用性。

InfoQ
新闻资讯8

阿里刚投的AI明星,3D模型那种

通用人工智能公司VAST宣布完成5000万美元A轮融资,由阿里、恒旭资本联合领投。其自研3D基础模型领先,发布全新AI 3D模型家族。2025年重点研发世界模型,2026年将加速建设UGC互动内容平台。

量子位
开源动态8

全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态模型Intern-S1 | WAIC 2025

7月26日,上海AI实验室在WAIC 2025上发布并开源『书生』科学多模态模型Intern-S1。它首创‘跨模态科学解析引擎’,在多学科专业任务上超越顶尖闭源模型,多模态综合能力领先主流开源模型

OpenMMLab
新闻资讯8

斯坦福教授直播训练535B模型模型训练背后的「黑箱」正在被打开?

斯坦福教授Percy Liang宣布由Marin开放实验室启动训练Marin 535B - A23B模型,全程公开。过去模型训练像“黑箱”,此次尝试让训练可观察、可讨论、可协作,引发网友关注。

机器之心
产品应用8

Qwen3-LiveTranslate:视、听、说全模态同传模型

Qwen3-LiveTranslate-Flash 是基于语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流模型

通义千问Qwen
开源动态8

模型开网店,谁是经营高手?E-Commerce Bench开源揭秘

为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异,还发现单一指标会掩盖模型表现,评估基准潜力

千问大模型
开源动态8

6.1B打平40B Dense模型,蚂蚁开源最新MoE模型Ling-flash-2.0

蚂蚁百灵模型团队开源 MoE 模型 Ling-flash-2.0,其以轻量级配置展现卓越性能,在推理速度、任务性能、部署成本间找到新平衡,为模型‘参数膨胀’提供新路径,还在多领域应用表现出色。

机器之心
产品应用8

模型虽好,但恕我直言:在OCR面前,开源小模型更香

作者所在公司项目需处理量纸质文档,起初考虑云端模型API调用和开源模型本地化部署,却因成本高、硬件要求高受阻。后经推荐调研PaddleOCR,其功能全、成本低、易用性强,最终被选为项目核心方案。

PaperAgent
算法论文8

启发学习:让模型认知从外化到内生

当下模型能力多靠人为框架,能力上限受限。文章提出“启发学习”,将其集成到推理侧成Isaac框架,通过Prompt与网络层注入复用旧经验,实验显示能幅提升模型任务性能。

机器之心