简单持续预训练」共找到 2905 篇相关文章

算法论文8

全球首次,Transformer「混血」速度狂飙65倍!英伟达已下注

康奈尔、CMU等机构研究者提出「混合体」Eso - LM,融合自回归和离散扩散模型范式。它引入KV缓存机制,推理速度相比标准MDM提升65倍,在速度与质量平衡上超越BD3 - LM,引发AI领域关注,英伟达或押注此方向。

新智元
算法论文7

微软等提出「模型链」新范式,与Transformer性能相当,扩展性灵活性更好

随着大语言模型发展,扩展 Transformer 架构成趋势,但参数规模增长带来训练负担。微软等研究者提出 CoR 概念,构建模型链学习范式,应用于语言模型得 CoLM 系列,实验显示其性能相当且扩展性、灵活性更好。

机器之心
开源动态8

开源2天斩获3K标星!开源TTS新星Chatterbox盲测击败ElevenLabs!

文本转语音(TTS)技术发展快,但达顶尖水平仍有挑战。开源TTS新星Chatterbox,开源2天冲上GitHub热榜,星标超3K。它功能亮点多,安装简单,适用于多种场景,性能超ElevenLabs。

开源星探
推荐文章7

一文讲透程序编排的核心方式:从表达式语言到并行化实践

文章围绕程序编排展开,介绍单语句编排、类编排、流程编排、并行化编排等核心方式,分析多种编排框架特点及适用场景,还提及Lindorm泛时序数据解决方案,为开发者提供编排参考。

阿里云开发者
算法论文8

ETT:打破原生多模态学习视觉瓶颈,重塑视觉tokenizer优化范式

本文由多机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在多模态理解、生成、重构任务表现出色,虽有局限但带来新突破。

机器之心
新闻资讯7

Claude 4被诱导窃取个人隐私!GitHub官方MCP服务器安全漏洞曝光

瑞士网络安全公司发现,GitHub官方MCP服务器面临新型攻击,可诱导AI Agent将私有仓库敏感数据泄露至公共仓库。GitLab Duo近期也有类似漏洞。公司还提出初步缓解举措。

量子位
算法论文7

DeepSeek用的GRPO有那么特别吗?万字长文分析四篇精品论文

文章解读 Kimi k1.5、OpenReasonerZero、DAPO 和 Dr. GRPO 四篇论文,分析 DeepSeek R1 里 GRPO 及改进算法。指出 GRPO 非特殊 RL 算法,当前 RL 算法实现相似,变革聚焦价值函数取舍等核心维度。

机器之心
产品应用8

一场对话,我们细扒了下文心大模型背后的技术

信通院大模型推理能力评估中,文心X1 Turbo获最高级“4+级”。百度AI Day上,副总裁吴甜解析文心4.5 Turbo和文心X1 Turbo,从多模态、深度思考等方面介绍技术,还展示其在多场景应用成果。

量子位
新闻资讯7

印度,拿什么实现自己的芯片梦?

印度近期在集成电路产业频有消息,两个半导体项目因资金问题搁浅。印度政府野心大,出台多项扶持政策,但其在芯片制造方面基础薄弱,实现半导体蓝图面临资金、人才、基建、营商环境等多重挑战。

芯师爷
新闻资讯9

换题还是第一!DM0.5横扫RoboColiseum四榜

本文报道原力灵机DM0.5在智元机器人发起的RoboColiseum具身模型评测中拿下四个单项第一,这已是该模型连续拿下六套不同类型公开评测的榜首,攻破了传统具身模型换题掉分的痛点,目前已开源落地产业场景。

机器之心