大模型新架构」共找到 9827 篇相关文章

推荐文章8

万字长文 | 异构算力技术架构与核心组件解析

文章聚焦异构算力技术架构与核心组件,解析主流AI芯片特点、国产芯片技术路线;介绍高速互联技术、网络拓扑结构及优化方法;阐述模型存储需求、分布式存储技术及数据预处理与加载技术,为AI计算提供全面方案。

AIGC开放社区
算法论文8

模型最后一层竟是推理累赘?绕开对齐税,奥数准确率暴涨 22.4%!

Qwen团队、清华和南洋理工研究打破传统认知,揭示‘对齐税’现象。提出Confident Decoding策略,在多架构和评测集实验中表现出色,开销低,挑战‘LLM最后一层最优’常识。

量子位
算法论文8

治好多模态近视和走神!上海学去偏干预显著提升模型性能

多模态模型存在“近视”和“走神”问题,总是过度关注图像底部而忽略核心内容。上海学与南开学研究团队用两条数学公式去偏干预,无需增加计算成本,却能显著提升主流模型视觉理解能力。

AIGC开放社区
算法论文7

老牌Transformer杀手在ICLR悄然更新:Mamba-3三改进趋近设计完全体

Transformer架构仍是AI主流,Mamba作为挑战者影响力。Mamba-3在ICLR 2026盲审,有梯形离散化、复数化状态空间模型、多输入多输出状态空间模型改进,实证表现佳,适合多场景。

机器之心
新闻资讯8

新天终启,万象智生!从AlphaGo到GPT-5,新智元十年见证ASI创世纪

2025年AI迈向ASI,新智元迎十周年,9月7日将在北京举办峰会。众多咖齐聚,探讨芯片、模型等前沿突破。今年模型发布密集,如OpenAI、谷歌等有新成果,中国造模型也表现出色,未来智能体等将爆发。

新智元
算法论文8

dLLM的「Free Lunch」!浙&蚂蚁利用中间结果显著提升扩散语言模型

近年来,扩散语言模型(dLLM)成为文本生成新势力,生成效率高。但现有解码策略忽视中间迭代信息,研究团队观察到「先对后错」现象,提出 TCV 和 TCR 方法,显著提升模型在推理任务表现。

机器之心
推荐文章7

对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型

InfoQ对话格灵深瞳灵感实验室,探讨多模态模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。

InfoQ
开源动态8

破解空间智能数据稀缺难题,影石开源DiT架构全景生成模型,在线可玩

影石研究院团队推出基于DiT架构的全景图像生成模型DiT360,设计分层混合训练框架,结合透视与全景图像数据,提升真实感和几何一致性。它支持多任务,优于现有方法,为三维场景生成提供新思路。

量子位
算法论文8

挑战扩散自回归统治!字节提出视觉生成第三种路线,让模型像人类一样边画边改

五一期间字节商业化技术团队研发出新一代视觉生成模型,其底层架构是全新的第三条路——生成精炼网络GRN。它能让AI像人一样边画边改,解决了现有模型的问题,在多项基准测试中刷新SOTA记录。

量子位
算法论文8

从少样本到千样本!MachineLearningLM给模型上下文学习装上「机器学习引擎」

新研究 MachineLearningLM 提出轻量可移植「继续预训练」框架,突破 LLM 在上下文学习局限,能学上千示例,在多领域分类任务超基准模型。它有三项核心创新,效果惊艳且应用潜力,还指明未来研究方向。

机器之心