「模型参数量」共找到 8093 篇相关文章
万字长文!大模型LLM推理优化技术总结
文章围绕大模型LLM推理优化技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优化、模型优化和模型服务等技术,如Pipeline并行、MQA、量化、动态批处理等。
Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功
九月刚过3天就有五个前沿模型发布,Meta发布Muse Spark 1.3踢馆谷歌Gemini 3.8 Flash。它跑分提升大、成本低,性价比高,但也遭质疑,大模型下半场或比拼系统架构和智能体工程能力。
性能不减,吞吐量提升6.4倍!英伟达用混合算子和架构定义小模型新标准
NVIDIA研究团队通过Nemotron - Flash系列模型,打破对‘深而瘦’架构迷信,修正缩放定律,用进化算法搜索混合算子、改进训练策略。该模型在性能、延迟和吞吐量上表现出色,远超同类产品。
SVG性能比肩GPT/Claude,腾讯开源3B模型HiVG,让Token「懂几何」
腾讯混元团队开源仅3B参数的HiVG,它是面向SVG生成的层次化分词框架,减少63.8% token数量,多项指标超越GPT-5.2等闭源模型及8B级开源模型,还在人类评测中表现出色。
终于,TRAE SOLO全量开放,我们用它复刻了PewDiePie的大模型智囊团
2025年AI Coding赛道上,TRAE是国产AI IDE代表作。7月其SOLO Beta版反响好,如今正式版全量推送。它定位为‘具备响应感知的编程智能体’,新增功能,还限时免费体验,实测显示开发能力强。
美团之后,京东也开始自研大模型了
京东发布JoyAI - LLM Flash模型,激活参数小、推理快。它采用混合专家架构等技术,在基础架构、数据加工、强化学习等方面表现出色,还通过多Token预测等技术加速推理,为商业场景落地扫清障碍。
OpenAI首个蛋白质模型披露更多细节,改进诺奖研究成果,表达量提升50倍
OpenAI与Retro Bio合作开发的GPT‑4b micro,是专为蛋白质工程设计的GPT-4o微型版本。它改进诺奖获奖蛋白变体,将干细胞重编程标记物表达量提升50倍,还能减少DNA损伤,研究团队公布更多突破细节。
首帧的真正秘密被揭开了:视频生成模型竟然把它当成「记忆体」
UMD、USC、MIT研究团队发现视频生成模型会把首帧当作‘概念记忆体’,将视觉实体存于首帧并在后续复用。基于此提出轻量方法FFGo,用少量例子让模型实现SOTA级视频定制。
LoRA中到底有多少参数冗余?新研究:砍掉95%都能保持高性能
这篇创新研究介绍了LoRI技术,证明即使大幅减少LoRA的可训练参数,模型性能依然强劲。研究团队在多个任务上测试了LoRI,发现仅训练LoRA参数的5%,LoRI就能匹配或超越其他方法的性能。
AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板
MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。