Llama3.1-8B」共找到 3392 篇相关文章

开源动态8

最强3B「小钢炮」,代码数据全公开!推理随意开关,128k超长上下文

Hugging Face推出30亿参数模型SmolLM3,支持128k长上下文,训练等全链路开放。它在架构、数据混合策略等多方面优化,性能超Llama3.2 - 3B等,还公开双模式指令模型构建方案。

新智元
新闻资讯8

软件 3.0 时代来临

OpenAI 联合创始人 Karpathy 在 AI Ascent 2026 大会提出软件正经历第三次范式转移。从 Software 1.0 到 3.0,人类参与编程方式不断变化,3.0 用自然语言编程,中间层应用被模型原生能力吞噬。

AGI Hunt
新闻资讯7

Qwen最新3.7 Max预览版空降!两代超大杯并行迭代,林俊旸走了但还在加速

Arena公布Qwen3.7-Max-Preview和Qwen3.7-Plus-Preview成绩,文本和视觉领域均为国产第一。Qwen3及以后迭代提速,大版本间隔缩至2-3个月,反映阿里Qwen团队进入快速实验、高频交付阶段。

量子位
开源动态7

一年后,DeepSeek-R1的每token成本降到了原来的1/32

几天前,DeepSeek更新R1论文至86页,公开训练全路径等细节。英伟达发表博客展示在Blackwell GPU上对其降本增效,通过软硬协同提升每瓦特Token吞吐量,还介绍了TensorRT - LLM软件及相关技术提升性能的情况。

机器之心
产品应用7

解读Qwen3文本嵌入与重排序技术版图

文本嵌入和重排序是NLP和信息检索关键组件。Qwen3 Embedding、Qwen3 Rerank模型基于Qwen3基础模型构建,有三种参数尺寸。文章介绍其架构、训练方案,还给出实战代码。

CourseAI
新闻资讯8

Anthropic发布Fable 5.1:科研、编程能力翻倍,成本最高降45%

当地时间9月1日,Anthropic推出Claude Fable 5.1和Claude Mythos 5.1。Fable 5.1科研、编程能力翻倍,成本最高降45%,还能解决实际问题,此次模型竞争转向多方面综合较量。

DeepTech深科技
开源动态8

MiniMax重磅开源M1模型:百万上下文超DeepSeek R1,实现性能与效率双杀

MiniMax正式开源首个推理模型M1,原生支持百万级上下文长度,在推理效率、计算成本和复杂任务能力上有独特表现。其在性能和效率上超越DeepSeek R1等模型,还提出创新强化学习算法。

AI科技大本营
新闻资讯8

国产「3D版Anthropic」再获数亿融资!60人初创,卡住全球3D脖子

影眸科技完成数亿元新一轮融资,发布全球首个具千万面级生成能力、引入‘先思考、再生成’逻辑的3D大模型Hyper3D Rodin Gen - 2.5。其有诸多优势,获多巨头认可,目标是定义空间智能底层规则。

新智元
产品应用7

超 10 万人都在看!Qwen3重塑文本嵌入与重排序技术版图

文本嵌入和重排序是NLP和信息检索关键组件。Qwen3 Embedding、Qwen3 Rerank模型基于Qwen3基础模型构建,有三种参数尺寸。文章介绍其架构、训练方案,还给出实战代码。

CourseAI
开源动态8

以小博大!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度

近年来大语言模型参数膨胀,成本升高,业界重注小语言模型。近日,Boss直聘南北阁大模型实验室发布仅30亿参数的Nanbeige4 - 3B,在多方面媲美甚至超越通义千问Qwen3系列模型,开源印证小模型潜力。

AIGC开放社区