双预训练架构」共找到 3616 篇相关文章

推荐文章7

当代码遇上大模型:智能编程助手的架构设计与工程实践

在 InfoQ 举办的 QCon 全球软件开发大会上,字节跳动段潇涵介绍如何基于大语言模型构建智能编程助手。他分享实践经验,剖析研发痛点,介绍技术架构,还探讨未来发展方向,如认知增强、工具整合等。

InfoQ
算法论文8

豆包是如何炼成的?字节放出自研万卡训练系统ByteRobust论文

文章介绍字节跳动的LLM训练基础设施ByteRobust。它由控制和数据平面构成,关键目标是获高ETTR。该系统优先快速隔离故障、考量人为错误、控制恢复可变性,已部署超一年,效果显著。

机器之心
算法论文8

无需训练的3D生成加速新思路:西湖大学提出Fast3Dcache

在AIGC浪潮中,3D生成模型虽进化快,但‘慢’和计算量大制约其应用。西湖大学AGI实验室提出无需训练、即插即用的Fast3Dcache框架,能在加速同时保持或提升模型几何质量。

量子位
开源动态8

开源即屠榜!UniME多模态框架登顶MMEB全球训练榜,刷新多项SOTA纪录

格灵深瞳等团队联合发布通用多模态嵌入新框架UniME,刷新MMEB训练榜纪录。它是两阶段框架,经文本判别知识蒸馏和困难负样本增强指令微调,在多任务达SOTA,项目已开源。

量子位
算法论文8

浙大提出Translution:统一Self-attention和Convolution,ViT、GPT架构迎来新一轮性能突破

近日,浙大与新加坡国立大学提出新型深度神经网络基础操作Translution,融合Self - Attention与Convolution优势,实现二者统一。基于它构建的网络在ViT和GPT架构下性能提升,但对算力要求更高。

AI科技大本营
算法论文8

75%预训练数据都能删!Jeff Dean新作:全自动筛除低质量数据

Google DeepMind团队开发的DataRater可全自动评估数据质量,用元学习筛选有价值数据,提升模型训练效率。它能减少计算量、提高性能,在低质量数据集效果佳,还能跨模型规模泛化。

新智元
新闻资讯7

仅凭一篇博客,他成功入职OpenAI!核心技术或用于GPT-5训练

Keller Jordan设计Muon优化器并公开研究进展,引OpenAI和xAI关注,最终加入OpenAI。Muon性能卓越,或用于GPT - 5训练,其故事暗示传统论文模式在AI领域或已落伍。

新智元
算法论文8

离职特斯拉“隐身”14个月,杨硕创业终于亮牌:重新定义机器人训练范式

杨硕从特斯拉擎天柱团队离职创业一年多后,妙动科技团队带来新论文《DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control》。该团队用视频训练机器人动作,提出DiT4DiT模型,解决VLA模型不懂物理问题,在人形机器人上有新突破。

量子位
新闻资讯7

你要做旁观者,还是定义者?中关村两院全球寻找「AI时代架构师」

中关村两院(北京中关村学院与中关村人工智能研究院)一体两院、融合发展,现全球招募AI时代架构师,包括领军人才、青年科学家、应届博士/博后等,介绍了招聘方向及优厚待遇,还将召开人才闭门交流会。

机器之心
新闻资讯8

奥特曼宣判Transformer死刑! AGI两年内降临,下一代架构已在路上

奥特曼在访谈中表示未来将有全新底层架构取代Transformer,还称AGI两年内降临,编程智能体是下一个引爆点。他回忆OpenAI草创期,还给出诸多判断,“后Transformer”竞赛也已打响。

新智元