算力大考」共找到 5547 篇相关文章

算法论文8

CVPR 2026|突破3D空间推理瓶颈:北联合南科提出QuatRoPE,让模型精准理解三维物体关系

联合南科团队提出全新 3D 位置嵌入方法 QuatRoPE,改善语言模型 3D 空间推理痛点。还提出 IGRE 降低干扰,构建 ASR 基准评估能力。研究被 CVPR 2026 接收,代码与模型已开源。

机器之心
新闻资讯8

2亿枚AI芯片爆发,人类最基建集体开工!

全球投入使用的AI芯片总算力相当于约2000万枚英伟达H100芯片,预计到2028年底达2亿枚。数据中心进入百万级算力时代,投入资金巨算力提升使模型和Agent能力增强,AI还参与自身研发优化。

新智元
新闻资讯7

刚刚,Sam Altman发文,透露OpenAI正在干的事业

OpenAI与甲骨文、软银合作新增5个AI数据中心选址,作为星际之门Stargate计划一部分,规划容量达近7吉瓦。CEO Sam Altman称构建强算力是AI兑现承诺关键,还发文阐述对算力观点。

机器之心
算法论文8

打破视觉Token的算力诅咒,RedundancyLens如何为多模态模型推理减负

多模态模型的 Decoder - only 架构处理视觉 Token 有计算冗余。合合信息团队提出无需额外训练的动态计算削减方法,在不影响性能前提下降低推理成本,适用于多场景。

PaperAgent
新闻资讯7

个人开发者训400亿参数模型:分布式算力,DeepSeek架构,3090单卡部署

Nous Research推出Psyche Network,可整合全球算力训练AI。它基于Deepseek的V3 MLA架构,有DisTrO优化器等技术,能让个人和小团体创建规模模型,还实现40B参数LLM预训练。

量子位
新闻资讯8

告别盲目卷参数!科讯飞1024亮出底牌:all in“更懂你”

在模型能力趋同当下,科讯飞在1024开发者节提出让AI“更懂你”。展示多模态超拟人“小飞老师”和「百变声音复刻」功能,发布星火X1.5模型,还推出多领域软硬件产品,赋能多行业。

量子位
新闻资讯7

256G内存条涨到天价:不是内存条疯了,是算力正在变成新土地

近期,256GB内存条单根突破4万元。这并非普通DDR5,而是服务器专用内存。其价格飙升源于供需错配,模型训练对容量内存需求极端。有人认为是泡沫,也有人觉得是结构性变化。

芯师爷
新闻资讯8

诺奖得主刚走,Gemini两核心叛逃Anthropic!

谷歌人才流失严重,一周内五名顶级研究员出走,Gemini两核心将入职Anthropic。同时,Gemini 3.5 Pro延期至7月。Alphabet股价下跌,市值蒸发超2000亿美元。原因或是上市期权诱惑和算力分配问题。

新智元
新闻资讯8

不只是DeepSeek V4,还有个万亿级模型,训推全程国产芯片

2026年4月24日,DeepSeek发布新一代模型DeepSeek - V4系列预览版并开源。同日,美团用全国产算力集群训练出万亿参数模型LongCat - 2.0系列预览版,训推全流程摆脱英伟达,在国产算力支撑万亿级模型研发上取得突破。

机器之心
算法论文8

省下1.25倍算力!Kimi这篇论文,可能改写所有模型的训练方式

模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。

AI寒武纪