Qwen2.5 - 7B」共找到 3467 篇相关文章

开源动态8

阿里Qwen3技术报告核心要点解读!

阿里Qwen3技术报告发布,披露模型架构、预训练及后训练等技术细节。其有密集与混合专家两种模型架构,预训练数据量和语种增多,后训练采用强到弱蒸馏提升性能,各模型表现优异。

PaperAgent
产品应用8

豆包大模型 Seed 2.0,有点不一样

大模型升级频繁令人审美疲劳,但豆包大模型Seed 2.0不同,其核心是Skills调用能力。作者测试了它做的小红书长图文排版生成器和古文翻译器,还体验了APP“专家模式”,展现多模态理解优势。

刘言飞语
新闻资讯7

刚刚!Claude Fable 5,又拿第一了

在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率登顶,成绩远超其他模型。它在不同语言上表现稳定,在稀缺语言中也只小幅度下降。这意味着前沿模型能独立完成部分中大型软件。

新智元
新闻资讯7

The Batch: 866|GPT-5 起飞遇乱流

OpenAI推出GPT - 5及其系列模型,涵盖多种类型,有新功能与性能提升。但发布中路由器故障等问题让用户失望。它在部分基准测试表现佳,不过抽象推理能力有不足,还回顾了发布历程。

DeeplearningAI
开源动态8

Agent 框架协议“三部曲”:MCP、A2A、AG-UI

文章介绍Agent框架的三个主流协议。MCP解决AI Agent和外部工具交互问题,获三大巨头支持;A2A促进独立Agent间通信,但MAS系统不成熟致其未普及;AG-UI解决AI Agent与前端应用交互标准化问题。

阿里云开发者
8

五年,终于等来Transformers v5

Transformers v5发布首个RC版本v5.0.0rc0,跨越从v4到v5长达五年的技术周期。其日下载量从2万次激增至超300万次,总安装量突破12亿次。v5将PyTorch确立为唯一核心后端,聚焦四大维度进化。

机器之心
推荐文章7

LightX2V Ulysses Attention 实现学习笔记

本文记录了LightX2V中Ulysses Attention的实现方式与张量形状推导。在多模态/视频场景,其实现可概括为一种layout变换,还提供`enable_head_parallel`和`use_fp8_comm`选项,效果受运行环境等因素影响。

GiantPandaLLM
新闻资讯7

DeepSeek,Qwen,Grok组团发布,社区一手实测

LLM大爆发,一天内推出Grok 4.6、Qwen3.8 - Max、DeepSeek - V4 - Pro - 0813三款前沿产品。社区对它们进行多场景测试,如3D场景、Flappy游戏、飞机滑行动画等,并对比了不同模型的性能、价格和输出质量。

PaperAgent
开源动态8

GitHub 狂飙 2.5 万标星,这款「会自愈」的 Python 爬虫框架杀疯了!

GitHub上爆火的Scrapling项目,是自适应Web爬虫框架。它能让爬虫‘学习’和‘适应’,解析器可自动定位元素,请求器能绕过反爬系统,性能强且支持多种会话类型,还能与AI工具集成。

开源星探
产品应用7

本地部署Qwen 3.8 27B,要用什么配置

Qwen 3.8 27B是性能好、体积小的开源模型,个人也能本地部署。本地跑开源大模型,重点看容量和带宽两个指标,还介绍了Mac、RTX 5090、RTX PRO 6000三种部署方案及优缺点。

newtype AI