大模型架构图」共找到 9791 篇相关文章

算法论文8

模型也需要自我反思,上海AI Lab合成“错题本”让模型数学成绩提升13.3%

上海AI Lab提出LEMMA方法,构建“错误 - 反思 - 修正”数据,让模型从错误中学习。通过教师模型定向制造“学生会犯的错”构造数据,实验显示在Llama3 - 8B上数学解题准确率提升13.3%。

量子位
产品应用8

千卡集群破壁之道:vivo视觉多模态模型训练效率跃迁实战

多模态模型在多领域需求增长,但千卡级 GPU 训练挑战。vivo AI 架构师王兆雄在会演讲,结合 LLaVA 和 DiT 模型实践,解析优化策略,分享提升训练效率与稳定性的经验,还展望了 AI Infra 未来。

InfoQ
算法论文8

模型时代,通用视觉模型将何去何从?

过去通用视觉模型(VGM)是研究热点,想实现‘视觉模型一统’。但语言模型发展使研究热点转移,视觉‘独立性’被重新定义。清华鲁继文团队综述梳理其进展,探讨现状、挑战与应用潜力。

机器之心
算法论文8

真·开外挂!MIT新研究:架构0改动,让模型解锁千万级上下文

MIT CSAIL团队提出递归语言模型RLM,不改动模型架构,让GPT - 5、Qwen - 3等模型具备千万级token超长文本处理能力。它将上下文处理“外包”,实验显示其处理规模超前沿模型,复杂任务优势显著,多数场景性价比高。

量子位
开源动态7

非Transformer架构的新突破,液态神经网络的推理小模型只用900M内存

谷歌提出的Transformer架构基本垄断模型,而初创公司Liquid AI研发的液态神经网络架构另辟蹊径。其发布并开源的LFM2.5 - 1.2B - Thinking模型,仅需900MB内存就能在端侧运行,性能优于Transformer架构模型,还降低了死循环生成比例。

机器之心
产品应用8

三星研究院发布手机端侧模型MeKi:基于Memory的LLM扩展新范式,支持旗舰手机端侧部署

三星研究院发布端侧模型架构MeKi,提出用存储空间扩展模型容量、提升LLM性能的新范式。它利用手机ROM缓解内存压力,实现容量与性能提升。实验显示其性能、效率表现优,为边缘部署LLM提供新思路。

AI科技评论
新闻资讯8

从 CIPS & CLM 迈进:中国模型的智能跃迁

中国中文信息学会2025学术年会暨第二届中国模型会(CIPS & CLM 2025)于10月28日在北京召开,众多专家学者参会。会聚焦模型多方面内容,发布“模型基金”,举办多场报告与论坛,展现中国AI领域进展。

AI科技评论
算法论文8

清华孙茂松团队 × 深言科技:以解释作为训练信号,让 8B 模型在幻觉检测上反超闭源模型

语言模型幻觉问题待解,成本与算力需求攀升。清华孙茂松团队联合深言科技提出FaithLens模型,把幻觉检测提升为整体评估,以解释作为训练信号,8B模型在多任务上超闭源模型

AI科技评论
算法论文8

230个模型在婴幼儿认知题上集体翻车!揭秘多模态模型的核心知识缺陷

ICML 2025研究揭示多模态模型在基础认知能力上表现不佳。研究者建测评题库CoreCognition测试230个主流模型,发现其存在核心知识缺陷,扩规模难补短板,还需补齐核心知识。

量子位
算法论文7

模型的第一性原理:(三)信息论篇

本文从信息论角度解读模型第一性原理。介绍Shannon信息论,提出将其从以BIT为中心转换为以TOKEN为中心解释模型底层原理,还阐述模型各阶段信息论原理、定向信息计算方法,对比Granger与Pearl因果。

机器之心