双解码器架构」共找到 2027 篇相关文章

开源动态8

Transformers来到了v5时代:从工具包到真理之源,AI时代的操作系统内核的极简进化论

Transformers v5发布,通过极简定义和极致互通成AI生态核心。它做减法重构代码、拓展训练流程、成推理引擎弹药库、提升量化为核心功能,连接训练、推理与部署,是AI生态通用语言。

AIGC开放社区
开源动态8

大模型开发者必读!拆解世界级AI模型的诞生,Hugging Face把4年模型训练经验写成了一本开源指南

Hugging Face发布《The Smol Training Playbook》,分享约4年构建SOTA模型和数据集的经验。手册涵盖是否训练、训练何种模型、如何训练等内容,强调数据质量重要性,还介绍了模型设计、训练中的实践与教训。

AIGC开放社区
新闻资讯7

2025谷歌博士生奖学金揭晓,清华、科大、南大等校友入选

本周四,谷歌公布2025年度博士奖学金入围名单,获奖者来自35个国家和地区、12个研究领域,共255名博士生。文章介绍了各领域的华人研究者情况,涉及算法、架构、人机交互等多个方向。

机器之心
算法论文8

NeurIPS Spotlight|运动遮挡都不怕,0先验、一段视频精准预测相机参数

论文一作李放等为解决传统方法在动态场景预测相机参数的难题,提出 ROS - Cam 方法,涵盖补丁式跟踪滤波器、异常值感知联合优化、阶段训练策略,代码即将开源。

机器之心
算法论文8

Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成翼齐飞

多模态AI前景广,但现有模型在理解和生成任务上存在性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,在多基准测试达SoTA水平,还展示图像编辑潜力。

深度学习自然语言处理
算法论文8

LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性丰收

LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。

机器之心
算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但小模型,大规模表现未知。

DeeplearningAI
推荐文章8

KV-Cache 实战策略:生产环境中的分页、固定与复用技术解析

在大语言模型推理场景中,KV - Cache 是平衡性能与成本的核心技术,但生产环境中面临诸多问题。本文聚焦其分页、固定与复用三大战术,结合原理、实践与案例,为开发者提供解决方案,还探讨了未来演进方向。

CourseAI
算法论文8

仅需152个样本,性能提升48%:Memory-R1如何重塑Agent记忆能力?

这篇文章解读论文Memory - R1,其由多所高校研究团队完成,旨在解决LLM在长对话和多轮任务中的‘记忆难题’。通过强化学习让LLM学会管理记忆,用152个问答对训练,大幅超越现有基线模型。

深度学习自然语言处理
开源动态8

阿里开源 Vivid-VR!带来逼真连贯的视频修复

阿里开源 Vivid - VR 用于视频修复,基于 T2V 模型结合 ControlNet 保证画面一致性。它引入概念蒸馏训练策略,设计控制特征投影器和分支 ControlNet 连接器,实验展现出优异表现。

带你学AI