大规模模拟平台」共找到 1770 篇相关文章

算法论文8

DeepSeek-V3再发论文,梁文锋署名,低成本训练大模型的秘密揭开了

DeepSeek 发布围绕 DeepSeek-V3 的技术论文,从硬件架构和模型设计双重视角,探讨实现经济高效的大规模训练和推理的方法。介绍了 DeepSeek-V3 的创新设计,如 DeepSeekMoE 架构、MLA 架构等,还给出未来硬件架构设计建议。

机器之心
开源动态8

32B 稠密模型推理能力超越 R1?中国秘密 AI 团队发布推理小模型 AM-Thinking-v1

2025年,国内神秘A - M - team在Hugging Face开源32B推理模型AM - Thinking - v1。它在多推理评测中击败DeepSeek - R1,与超大规模模型成绩相当。团队靠后训练方案挖掘32B模型潜力,探索小体量实现大能力路径。

AI科技评论
新闻资讯7

太狠了!为了锁死DeepSeek,Anthropic要求加大AI芯片出口管制

全球著名大模型平台Anthropic发布文章,赞同并建议特朗普制定更激进规则限制AI芯片出口,以保持美国在与中国AI竞争中的领先地位,还污蔑中国运输芯片方式,拿DeepSeek举例说明芯片限制影响,并提出三点限制建议 。

AIGC开放社区
产品应用8

Qwen3.8-Flash:全新架构,更强更稳更划算

本文介绍了 Qwen3.8-Flash 多模态 MoE 模型,它原生支持 262,144 token 上下文。该模型在 Attention、Residual、Embedding 与 Optimization 四个方面系统升级,降低训练与推理成本,即将上线千问 AI 平台。还发布了 Qwen3.8-Flash-Next 开源权重。

千问大模型
产品应用8

Qwen3.8-Max:编程与办公,全面跃升

今日正式发布Qwen3.8-Max,下周将开源其及Qwen3.8 - 27B模型权重。它参数达2.4万亿,在多方面全面提升。开发者可通过千问AI平台获API服务,性价比高。在编程、办公等场景表现出色,用户反馈良好。

千问大模型
8

纯CPU“踢开”GPU,中国超算九年后再登顶!

6月23日,国家超级计算深圳中心“灵晟”超算以2.19EFlops性能登顶全球超算TOP500榜单,这是世界首台超2EFlops的超算系统。它基于“灵鲲”平台,采用纯CPU设计,展现我国超算全栈自主可控能力。

芯师爷
新闻资讯7

Cyber天花板被打穿!AISI实测Mythos能力正以4.5月翻倍速冲向ASI

英国AI安全研究所(AISI)实测Anthropic的Mythos和OpenAI的GPT - 5.5,发现其网络攻防能力4.5个月就能翻倍,加速冲向ASI。Mythos在模拟企业内网32步渗透任务中表现出色,瓶颈在于Token而非智力。

新智元
算法论文8

PRSA 2025 | RPI Nithin Somasekharan、Shaowu Pan(潘韶武):突破柯尔莫哥洛夫屏障——面向模型降阶的可学习加权混合自编码器

本文将线性POD与非线性Autoencoder通过可学习参数融合,提出可学习加权混合自编码器架构。在多数据集验证中,该方法克服了POD和纯AE的局限,在复杂PDE系统预测中表现出色,或可降低大规模计算成本。

力学与人工智能
算法论文8

AST | 西工大崔榕峰、张伟伟等:基于物理约束与双并行注意力UNet++的高保真度三维机翼流场重构研究

传统高保真CFD模拟计算资源消耗大,现有深度学习方法处理三维流场重建面临挑战。本文提出物理约束双并行注意力UNet++框架,实验表明其在流场重构精度上较传统U - Net提升约10%,预测速度提升2 - 3个数量级。

力学与人工智能
新闻资讯7

Claude凭空造假强行部署,比黑客更可怕的入侵者!Vercel CEO紧急预警

Vercel CEO曝光一起AI安全事件,基于Claude Opus 4.6的AI编程智能体凭空编造GitHub仓库ID,将学生作业部署到企业环境。这揭示AI失效模式与人类迥异,还引出包幻觉攻击风险,同时提到OpenAI秘密开发代码平台

新智元