小模型」共找到 8112 篇相关文章

产品应用8

Qwen3.5实战教程:从0到1掌握本地部署与微调

阿里通义千问团队发布Qwen3.5系列小模型,打破“大模型=高成本”惯例。本文全面剖析该系列模型,涵盖核心特性、本地部署实战、模型微调实战,还给出技术细节与问题解决办法。

机器学习AI算法工程
开源动态8

突发!字节开源 36B 模型Seed-OSS

字节跳动Seed团队开源Seed-OSS系列36B模型,用12T tokens训练,采用Apache-2.0许可证。该模型能灵活控制推理预算,有两个基座版本,Instruct版在多方面表现强劲,性能碾压OpenAI开源模型

AGI Hunt
推荐文章7

他们还没毕业,就在用AI搭建自己的世界|五源酒馆Vol.30 x AI Native创造者

本期五源酒馆邀请三位年轻AI Native创造者,分享AI学习与创造经历。他们谈及AI对生活工作的改变、关注的产品及模型,探讨资源分配、AGI突破等问题,还交流了未来能力培养和给十年后自己的话。

五源资本 5Y Capital
开源动态8

蚂蚁开源 x SGLang Meetup技术回放解读系列之面向DeepSeek系列模型的深度优化与实践

文章是对蚂蚁开源x SGLang Meetup中「蚂蚁Theta面向DeepSeek系列模型的深度优化和实践」分享的解读,详细介绍了在H20-96G上对DeepSeek系列模型推理的优化方案,包括Prefill和Decode阶段的优化、通信优化、观测诊断等,并给出了评测结果。

GiantPandaLLM
新闻资讯8

拐点出现,中国开源大模型下载量超越美国

Interconnects.ai报告显示,截至2025年8月,中国开源大模型在HuggingFace下载量快赶上美国,增长速度更快,派生模型数量增多。美国因结构、生态等问题落后,中国模型优势在于速度、迭代等。

鲸选AI
算法论文7

一场「狼人杀」,考倒了一堆大模型

南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。

AI科技评论
算法论文7

SOTA大模型遇上加密数据评测:Qwen3未破10%,o1也栽了丨上海AI Lab等联合研究

当前推理模型在基准测试中性能卓越,但在密码学领域推理能力待探索。上海AI Lab等推出CipherBank评测,用海量真实隐私场景数据和多类型密码算法挑战SOTA大模型,结果显示模型表现不佳,还分析了模型“犯难”原因。

量子位
产品应用8

终于有AI视频模型,解决了体操难题。

前天深夜MiniMax发布Hailuo 02视频模型,虽未正式上线但放了预告片。该模型能生成杂技动作,解决了体操难题,在复杂动作肢体表现上吊打其他模型,还支持原生1080P,价格便宜。

数字生命卡兹克
新闻资讯7

Anthropic "泄露"Claude Mythos 最强模型到底有多猛?

Fortune爆出Anthropic因CMS配置失误,致新模型Claude Mythos信息泄露。该模型有阶跃式进步,在多领域表现超前代,网络安全能力突出。此事反映AI迭代快但安全待提升,安全成模型评估关键。

CourseAI
开源动态7

Qwen3又又又发布了新模型~~~

Qwen3团队继发布`Qwen3-235B-A22B-Instruct-2507`和`wen3-235B-A22B-Thinking-2507`后,又发布`Qwen3-Coder-30B-A3B-Instruct`。该简化模型性能和效率出色,有多项关键增强功能,且是非思考模型,输出效率高。

CourseAI