大模型预训练」共找到 9569 篇相关文章

算法论文8

7篇顶会NeurIPS 2025最佳论文都说了什么?

NeurIPS 2025七篇获奖论文揭示模型思维同质化、推理能力虚幻边界等隐忧,也在注意力机制、神经扩展定律等方面取得物理学层面突破,为AI建立更严谨科学地基。

AIGC开放社区
新闻资讯7

突发!快手AI掌舵人周国睿即将离职,下一站爆出

多个媒体爆料,快手副总裁、基础模型及推荐模型负责人周国睿即将离职,目前本人在快手内部系统显示为休假状态。其去向不明,有传加入Meta或TikTok,官方未回应。

新智元
开源动态8

小扎又开源了:7B实现自监督学习SOTA

Meta发布全新开源视觉模型DINOv3,首次证明自监督学习模型能在广泛任务中超越弱监督学习模型。它用无标注方法,扩展数据和模型规模,支持标注稀缺场景,在多任务实现SOTA。

量子位
开源动态8

国产开源新突破!5万小时真机数据,撕开行业最痛点

蚂蚁灵波开源具身操作基座模型LingBot-VLA 2.0,用同一套模型「驯服」20种机器人构型。它覆盖5万小时真机数据,在通用泛化能力上全面升级,还带来三底层技术革命,可降低重复适配成本。

新智元
开源动态8

阿里刚刚开源了一款影视级配音项目,口型同步、音色转换都不是事!

阿里通义实验室语音团队联合中科发布多模态电影配音模型Fun - CineForge,开源模型并构建中文电视剧配音数据集。它能处理多种场景,有视频理解等亮点,还给出制作数据集步骤。

开源星探
算法论文8

清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026

语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。

AI科技评论
推荐文章7

企业数字化转型新引擎:MCP + LLM + Agent 架构赋能!

本文介绍MCP(Model Context Protocol)模型上下文协议,它是Anthropic于2024年11月底推出的开放标准,可统一模型与外部数据源和工具通信协议,打破数据孤岛,有诸多优势,还适用于多个场景。

MCP Server
算法论文7

-清华-腾讯发布:音频 - 视觉多模态任务统一框架

、清华和腾讯合作发布Crab论文,目标是实现多模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,构建数据集、设计LoRA结构、统一架构,训练分预训练和指令调整两阶段。

CourseAI
算法论文8

2篇最新152页论文,RL+LLM被彻底讲透了!

今天分享2篇2025最新RL×LLM的技术综述,分别聚焦“RL在LLM全生命周期的打法”和“RL如何炼成推理模型”,梳理玩法、组件、算法演进等内容,还给出开源模型、数据等盘点。

PaperAgent
产品应用8

不是,高考刚结束,高考报志愿的Agent也来了?

夸克官宣夸克高考志愿模型,虽未多提Agent,但作者认为其比Agent还Agent。该模型免费,以Qwen为基座,结合高考知识库,能生成详细志愿报告,考虑多方面需求,助力学子报志愿。

数字生命卡兹克