自回归架构」共找到 2872 篇相关文章

算法论文8

NeurIPS 2025|VFMTok: Visual Foundation Models驱动的Tokenizer时代来临

传统视觉 Tokenizer 存在缺乏高层语义信息、冗余度高、表征混乱等问题。香港大学 CVMI Lab 和阶跃星辰 AIGC 团队提出 VFMTok,用预训练视觉基础模型构造视觉 Tokenizer,实验显示其性能优异。

机器之心
算法论文8

LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性双丰收

LeCun团队提出LLM - JEPA,将JEPA监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。

机器之心
开源动态7

DeepSeek 新模型 R1-0528 悄悄开源,与o3 相当,实测来了。

DeepSeek团队悄无声息地在Hugging Face上开源推理模型新升级版DeepSeek R1-0528,基于DeepSeek-V3-0324模型,架构和训练方法有改进,性能与o3相当,实测表现不错。

AI进修生
开源动态8

8K Star!给所有 AI 编程工具加个智能调度中心,节省 20-40% Token!

AI编程圈火了个工具9Router,它是智能调度中心,能连接主流编程工具,动路由到40多家AI提供商和100多个模型,带RTK Token节省器,还有实用的三级降级机制,安装配置简单。

开源星探
产品应用7

面壁MiniCPM4推理速度3倍,碾压同尺寸Qwen3,阿里上眼药了~

面壁发布包含10个模型的MiniCPM4系列,其推理速度快。它有高效模型架构、学习算法、高质量训练数据和推理系统等创新点,还给出了MiniCPM4实战代码及启用InfLLM v2的参数设置。

CourseAI
开源动态8

Qwen3新成员:Embedding系列模型登场!

今天正式发布Qwen3-Embedding系列模型,专为文本表征等任务设计,继承Qwen3多语言理解优势。在多项基准测试表现卓越,已在多平台开源,有卓越泛化性、灵活架构与多语言支持等特点。

通义千问Qwen
开源动态7

YC总裁开源个人AI记忆系统GBrain:让你的OpenClaw/Hermes长脑子

YC总裁Garry Tan开源GBrain,这是经实战检验的AI记忆中枢。它有真实数据规模、混合搜索架构等特点,核心工作流含实体检测等。技术选型有考量,还提供体验方式和技能包文档。

AI工程化
新闻资讯8

阿里成立Token Hub事业群,打碎钉钉,做成龙虾!

阿里巴巴成立Alibaba Token Hub事业群,首席执行官吴泳铭挂帅。旗下设5大事业部,目标是创造、输送和应用Token。还发布企业级旗舰应用悟空,重写底层架构,打造专属文件系统与Skill生态,展示多款智能硬件。

AIGC开放社区
推荐文章7

AI时代,最老的设计哲学反而最有效

50年前的Unix哲学‘万物皆文件’和‘文件夹即应用’正以意想不到的方式回归。过去因‘人类可理解性’被推崇,如今因AI能操作而重获重要性,文件夹成‘智能空间’,AI成其操作系统。

newtype AI
开源动态7

直播预约 | LightMem:面向大模型的轻量化可插拔记忆系统

本报告聚焦大语言模型长期记忆构建与轻量化机制。现有外部记忆系统有记忆臃肿、组织低效、更新代价高问题。为此提出LightMem架构,能为大模型提供轻量、高效、可扩展记忆组件。

深度学习自然语言处理