大模型架构」共找到 9813 篇相关文章

开源动态8

刚刚,小红书开源了首个多模态模型dots.vlm1,性能直追SOTA!

小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。

新智元
算法论文8

复旦、同济和港中文等重磅发布:强化学习在语言模型全周期的全面综述

来自多所顶尖科研机构的研究者完成长文综述,总结语言模型全生命周期的强化学习研究,阐述其各阶段应用策略,分析未来挑战与趋势,重点关注 RLVR 技术,有全生命周期梳理等三贡献。

机器之心
算法论文8

前OpenAI科学家&GPT之父:预训练精准数据过滤,极低成本削弱模型危险能力数千倍

Claude价值观塑造者Neil Rathi和GPT之父Alec Radford发论文,提出预训练时精准“删掉”危险知识碎片,以极低计算成本将模型特定危险能力削弱数千倍,且不损通用智能。

AIGC开放社区
新闻资讯8

谷歌新架构突破Transformer超长上下文瓶颈!Hinton灵魂拷问:后悔Open吗?

谷歌在NeurIPS 2025发布两项模型架构研究,通过‘测试时训练’机制,推理阶段可将上下文窗口扩展至200万token。新成果Titans和MIRAS结合RNN速度与Transformer性能,突破超长上下文瓶颈。

量子位
开源动态8

Issue修复开源No.1!蚂蚁 | 提出代码图模型:CGM,结合GraphRAG架构,领先最强开源7.33%

为解决开源模型在仓库级代码理解上的能力瓶颈,蚂蚁全模态代码算法团队提出 CGM 架构,融合仓库结构与语义信息。CGM 首创图结构与语言模型融合的对齐框架,还搭配了 GraphRAG 框架,在多个代码任务中表现出色,且相关资源均已开源。

AINLPer
算法论文8

ACL 2025 | 清华&港中文提出 MorphMark:全新理论视角破解模型水印效力与文本质量的两难困境

随着模型广泛应用,AI 生成内容追溯和版权保护成问题,现有水印技术面临效力与文本质量的矛盾。清华和港中文团队提出 MorphMark 自适应水印框架,动态调强度,在多模型实验中表现优。

深度学习自然语言处理
新闻资讯7

模型低价趋势延续!智象未来姚霆:B端、C端界限模糊,API不够、逼出 “按结果付费”

InfoQ 采访智象未来联合创始人姚霆,探讨多模态模型发展。他指出深度 Scaling up 收益放缓,广度 Scaling up 有惊喜;2025 年模型价格战倒逼厂商加速,低价趋势 2026 年将延续,商业模式转向“按结果付费”。

InfoQ
算法论文8

训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港×MIT联手重新定义扩散模型训练速度上限

NVIDIA、港、MIT团队提出Sol - RL,采用「FP4先探索、BF16再训练」框架,将扩散模型训练收敛速度最高提至4.64x,在速度与对齐效果间给出工程可行解法。

机器之心
算法论文8

斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4

斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等模型。论文解决了RL在代理环境中可变时长动作优化偏差和稀疏奖励两挑战,为AI代理发展指明方向。

深度学习自然语言处理
产品应用7

秒级集群翻转、分钟级IDC故障止损 | 同程规模Elasticsearch平台架构设计与实践

在数据驱动时代,同程旅行核心业务依赖Elasticsearch,随着集群规模扩,面临对用户、运维、平台要求高的挑战。本文分享同程ES平台架构设计、解决方案与实践成果,还展望借助模型提升智能化水平。

InfoQ