模型训练与微调」共找到 8113 篇相关文章

算法论文7

AST| 西工大单湘淋、张伟伟等:基于湍流各向异性分析与符号回归的改进型二阶非线性涡粘模型

针对非线性涡粘模型各向异性建模难题,西工大单湘淋、张伟伟等通过雷诺应力各向异性分析方法开展特征提取,构建新型二阶非线性涡粘模型,在方形管道与矩形扩压器湍流测试中,精度优于现有模型

力学与人工智能
新闻资讯8

不只是DeepSeek V4,还有个万亿级大模型,训推全程国产芯片

2026年4月24日,DeepSeek发布新一代模型DeepSeek - V4系列预览版并开源。同日,美团用全国产算力集群训练出万亿参数大模型LongCat - 2.0系列预览版,训推全流程摆脱英伟达,在国产算力支撑万亿级模型研发上取得突破。

机器之心
开源动态8

里程碑!逻辑智能发布全球首个完全开源语音大模型框架LLaSO,语音AI迎来新纪元

逻辑智能发布全球首个完全开源语音大模型框架LLaSO,它像“全家桶”,提供高质量数据、统一评测基准和强大基础模型。语音大模型发展遇瓶颈,LLaSO框架及参考模型LLaSO - Base有望打破僵局。

AI科技评论
算法论文8

阿里通义发布并行计算新策略:1.6B等效4.4B,内存消耗骤降95%

阿里通义团队提出PARSCALE并行计算新策略,受CFG双路径推理机制启发,将并行思想扩展到训练和推理全流程。能让1.6B模型性能接近4.4B模型,内存占用大降,还可用于现有模型,无需从头训练

量子位
新闻资讯7

Anthropic宣布练出神话级模型:Claude Mythos,代码和黑客能力吊打opus4.6,不向公众开放!

Anthropic宣布Project Glasswing计划,因训练出超强模型Claude Mythos Preview。该模型代码和推理能力超opus 4.6,扫描主流软件发现数千零日漏洞。此模型不向公众开放,计划先在Claude Opus验证安全机制。

AI寒武纪
算法论文8

九成以上模型止步白银段位,只有3个铂金!通用AI下半场评测标准来了

OpenAI研究员姚顺雨提出AI发展步入新阶段,下半场关键在评估模型真实智能。新加坡国立大学等团队提出“通才智能”评测框架,剖析多模态大模型短板,推出五级评估体系和测试集,测试结果暴露模型弱点,引发社区积极反响。

机器之心
新闻资讯7

顶尖技术+标准产品+创新模式+可靠服务,打造大模型商业落地中国范式 | 卓世科技@MEET2026

在大模型参数竞赛白热化的当下,焦点转向模型如何在行业存活、产生价值。卓世科技合伙人赵策在MEET2026大会提出,大模型下一场竞争在模型、终端、数据与业务流闭环,该司据此在多领域落地应用。

量子位
算法论文8

景不动人动,MLLM如何面对「移步换景」的真实世界?OST-Bench揭示多模态大模型在线时空理解短板

上海多所高校研究者提出 OST - Bench,从智能体探索场景动态在线视角挑战大模型能力。它更贴近真实世界,揭示主流多模态大模型在线时空理解短板,为未来模型发展指明方向。

机器之心
开源动态8

狂涨10.3K star!最近爆火的微信记录训练专属数字分身,支持语音克隆,绝了!

在AI大模型时代,大家想让模型更个性化。最近GitHub爆火的开源项目`WeClone`,用微信聊天记录训练专属AI打造数字分身,还能语音克隆。它全链路覆盖、支持多模型,有隐私保护等特色,操作也有介绍。

开源先锋
开源动态7

国产开源大模型:再见9月,你好10月~

9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。

PaperAgent