「大模型预训练」共找到 9522 篇相关文章
腾讯混元推出首款开源混合推理模型:擅长Agent工具调用和长文理解
6月27日,腾讯混元开源首个混合推理MoE模型Hunyuan - A13B,参数80B激活仅13B,推理快性价比高。它在多测试集成绩好,尤其擅长Agent工具调用和长文理解,还开源两数据集填补评估空白。
突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度
在多模态大语言模型应用多元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。
长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”
北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。
Anthropic史诗级泄密!全新模型意外曝光:能力碾压Opus 4.6,因太危险被限制发布
Anthropic重大泄密,全新模型“克劳德神话”(Claude Mythos)及Capybara层级曝光。新模型性能超Claude Opus 4.6,但因网络安全隐患大未全面发布,首批仅给安全机构。泄密源于配置失误。
阿里开源电影级AI视频模型!MoE架构,5B版本消费级显卡可跑
阿里开源新一代视频生成模型通义万相Wan2.2,含文生视频等功能。它率先将MoE架构用于视频生成扩散模型,5B版本可在消费级显卡部署。对比前代和Sora表现更优,还推出电影级美学控制系统。
Wispr Flow 平替, 这款开源中文语音助手,程序员真该试试,本地离线的中文语音输入神器来了(开源白嫖版)
蛐蛐(QuQu)是开源桌面应用,用本地语音识别模型和配置的大语言模型,将语音实时转文字并润色。它主打本地语音工作流,替代Wispr Flow,免月费且保护隐私,适合中文用户。
全新稀疏注意力优化!腾讯最新超轻量视频生成模型HunyuanVideo 1.5核心技术解密
腾讯混元大模型团队发布并开源轻量级视频生成模型HunyuanVideo 1.5,参数8.3B,支持5 - 10秒高清视频生成。它通过多层次技术创新,在生成效果、性能与尺寸上实现平衡,还具备多种核心能力。
国内外AI大厂重押,初创梭哈,谁能凭「记忆」成为下一个「DeepSeek」?
文章指出‘记忆’或成引爆新一轮AI浪潮的关键。当前,国内外AI大厂和初创企业纷纷入局,围绕‘记忆’研究是大模型新方向。‘记忆’是技术和应用的双重诉求,研究路线多样且各有优劣,未来竞争激烈,谁能突围尚未可知。
阿里AI 重磅第4发:电影级MOE 视频模型Wan2.2正式开源!
阿里通义团队开源电影级视频生成模型Wan2.2,将光影、色彩、镜头语言装进模型,支持60多参数自由组合。它是业界首个用MoE架构的视频生成模型,推理省计算资源,性能超主流模型,获国外网友盛赞。
训练成本暴降99%,35秒出1分钟高清视频!英伟达MIT等引爆视频AI革命
英伟达联合MIT、港大团队提出SANA - Video架构,其核心是创新的全局线性注意力Diffusion Transformer训练框架和全局显存恒定的KV缓存机制。它训练成本低、速度快、可部署,重新定义AI视频生成效率极限。