超稀疏MoE」共找到 2280 篇相关文章

算法论文8

智能体并非越多越好,45%准确率成关键拐点

Google研究《Towards a Science of Scaling Agent Systems》验证“智能体并非越多越好”。在GPT等上实验发现,单个智能体准确率45%,增加数量会损性能,还揭示工具税、错误螺旋等问题,给出预测公式。

AI工程化
开源动态8

Kimi K2 Thinking,最强思考模型,附实测

Moonshot AI发布Kimi K2 Thinking模型,它能边思考边行动,是目前最强开源思考模型,多项指标GPT - 5等闭源巨头。其具独特架构,有性能优势,还给出部署方式,实测表现佳。

AGI Hunt
开源动态8

CAIR开源发布声基座大模型EchoCare“聆音”,10余项医学任务性能登顶

2025年9月17日,CAIR开源发布声基座大模型EchoCare“聆音”。它基于450万张影像数据集训练,在10余项医学任务测试中表现卓越。首创结构化对比自监督学习框架,为AI医疗应用提供创新路径。

机器之心
开源动态8

阿里开源 Wan2.2-Animate!统一角色动画和视频人物替换

阿里通义实验室开源 Wan - Animate,这是用于角色动画与替换的统一框架。它构建于 Wan 模型之上,支持角色动画和角色替换两项核心功能,性能现有算法,还通过独特设计实现多种效果。

带你学AI
新闻资讯7

OpenAI估值暴涨至5000亿美元,并出售103亿美元股票

今天凌晨3点CNBC消息,OpenAI以5000亿美元估值出售103亿美元二级股票,规模较原计划提升40亿美元。数月内其估值大幅提升,投资方阵容强大,此举措延续行业趋势。

AIGC开放社区
开源动态8

蛋白质基座的GPT时代来了?!

清华大学周浩课题组联合上海人工智能实验室发布蛋白质基座模型AMix - 1,以系统化方法论构建,实现蛋白质基座领域从BERT到GPT时代跨越,有四大‘能力’,设计的蛋白活性提升50倍,代码等已公开。

量子位
推荐文章8

硬核拆解大模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构

本文详细列举 8 个主流大语言模型,硬核拆解架构设计与革新思路,介绍架构演进趋势。如 DeepSeek-V3 的 MLA 与 MoE 技术,OLMo 2 的归一化策略,Gemma 3 的滑动窗口注意力机制等。

机器之心
新闻资讯8

新紫光集团三周年:智变跃升,交出硬核答卷

2025年7月11日新紫光集团完成战略重整三周年,交出硬核答卷,连续三年营收千亿,专利增加。其聚焦智能科技主业,通过战略布局、技术攻坚、生态协同实现发展,未来将持续求新求变,深化合作。

芯师爷
7

ChatGPT卸载暴涨413%,Claude下载激增100%!奥特曼帝国开始漏水了

4月29日消息,Anthropic正谈判新一轮融资,估值或破9000亿美元,将OpenAI。ChatGPT卸载量暴涨,Claude下载激增。OpenAI星际之门项目进展不佳,人才流失,而Anthropic凭借Claude获企业认可。

新智元
开源动态8

外卖公司也能搞AI?

昨天凌晨美团悄悄开源560B参数的MoE大模型LongCat-Flash-Chat,引发国外网友疑惑。该模型推理速度100 tokens/秒,基准测试表现出色,多项设计解决实际问题,贴合美团业务需求。

AGI Hunt