复合模型架构」共找到 8498 篇相关文章

开源动态8

北大提出首个复数大模型,2比特量化,推理仅加法,可手机部署!

北大团队提出iFairy方案,将模型权重量化到复数集合,用2比特表示,压缩至原本1/8。推理仅需加减或交换数据位置,成本更低。Transformer架构“复数化”,iFairy模型PPL降10%,性能反超全精度,相关成果已开源。

量子位
产品应用7

京东广告大模型实战:GRAM 架构如何在 50ms 内完成生成式推荐?

流量红利见顶,广告营销转型遇挑战。京东张泽华在大会公开应对方案,介绍 GRAM 架构,实现意图与商品语义对齐,控制推理时延,解决冷启动等问题,还分享算法与知识工程实践。

InfoQ
算法论文8

解决特斯拉「监督稀疏」难题,DriveVLA-W0用世界模型放大自动驾驶Data Scaling Law

自动驾驶领域VLA大模型面临‘监督稀疏’难题,特斯拉公布此挑战。DriveVLA - W0研究提出用世界模型解决,将‘预测未来图像’作自监督训练任务,还提出轻量级架构降低推理延迟。

机器之心
产品应用8

千卡集群破壁之道:vivo视觉多模态大模型训练效率跃迁实战

多模态大模型在多领域需求增长,但千卡级 GPU 训练挑战大。vivo AI 架构师王兆雄在大会演讲,结合 LLaVA 和 DiT 模型实践,解析优化策略,分享提升训练效率与稳定性的经验,还展望了 AI Infra 未来。

InfoQ
开源动态8

破解空间智能数据稀缺难题,影石开源DiT架构全景生成模型,在线可玩

影石研究院团队推出基于DiT架构的全景图像生成模型DiT360,设计分层混合训练框架,结合透视与全景图像数据,提升真实感和几何一致性。它支持多任务,优于现有方法,为三维场景生成提供新思路。

量子位
算法论文8

挑战扩散自回归统治!字节提出视觉生成第三种路线,让模型像人类一样边画边改

五一期间字节商业化技术团队研发出新一代视觉生成模型,其底层架构是全新的第三条路——生成精炼网络GRN。它能让AI像人一样边画边改,解决了现有模型的问题,在多项基准测试中刷新SOTA记录。

量子位
开源动态8

原生理解生成统一:商汤开源SenseNova U1,用统一架构终结「缝合怪」多模态

商汤开源日日新 SenseNova U1 系列原生理解生成统一模型,采用 NEO-unify 架构,只需 8B 小参数就能实现很多商业闭源模型效果。在多测评维度性能领先,还能实现连续性图文创作输出,解决理解与生成断层问题。

机器之心
新闻资讯8

领先于Transformer!新架构首个1200万上下文模型SubQ,成本仅Opus的5%

Subquadratic公司提出SubQ模型,核心是SSA亚二次稀疏注意力机制。该机制改变注意力计算分配,让模型真正读长文档。SubQ是首个有1200万token上下文窗口的前沿模型,成本低、速度快,有望革新大模型扩展路径。

机器之心
产品应用8

国产AI首次「长出」原生记忆,非Transformer架构成新王!机器狗当场引爆WAIC

WAIC世界人工智能大会上,国产黑马RockAI的大模型Yan 2.0 Preview亮相,可多终端无损部署。它基于非Transformer架构,训练效率高,有原生记忆,实现端侧AI,展现出自主学习和多模态能力,引发关注。

新智元
算法论文8

航空发动机用上大模型:解决复杂时序问题,性能超越ChatGPT-4o实现SOTA|上交创智复旦

上海交通大学李元祥教授等团队提出ITFormer架构,构建EngineMT-QA数据集。ITFormer能融合时序数据与大语言模型,适配多种编码器和模型,在EngineMT-QA预训练后达SOTA水平,实现高效数据分析。

量子位