Adam优化器」共找到 1419 篇相关文章

开源动态8

万亿参数狂欢!一文刷爆2025年七大顶流大模型架构

文章深入剖析2025年顶级开源模型的创新技术,介绍了DeepSeek V3/R1、Kimi 2、Qwen3等七大顶流大模型架构,揭示滑动窗口注意力、MoE和NoPE如何重塑效率与性能。

新智元
开源动态8

Kimi K2官方技术报告出炉:采用384个专家,训练不靠刷题靠“用自己的话再讲一遍”

Kimi K2官方技术报告公开称霸全球开源模型的秘籍,介绍其训练过程及“秘密配方”,包括MuonClip优化、大规模Agentic Tool Use数据合成等技术亮点,还提及后阿里通义Qwen3更新击败Kimi K2。

量子位
技术文章8

加一个JVM参数,让系统可用率从95%提高到99.995%

文章针对高并发系统不稳定问题,定位是系统内存索引切换时 GC 压力大所致。围绕让索引尽早晋升、直接分配到老年代等思路探索优化,经多番尝试,最终实现索引无感切换,使系统可用率达 99.995%。

阿里云开发者
产品应用7

消费级显卡跑大模型训练门槛再降:Qwen3-1.7B强化学习只需5GB显存

消费级显卡跑大模型训练门槛再降,Unsloth AI的FP8精度强化学习方案让Qwen3 - 1.7B的GRPO训练只需5GB显存且性能无损。该方案与TorchAO合作,有推理优势,还在内存优化等方面表现出色。

AI工程化
产品应用7

吃灰 AI 眼镜爆改“交警 Copilot”,函数计算AgentRun 实操记录

作者将吃灰的Meta Ray - ban眼镜爆改成“交警Copilot”,介绍了“端 - 管 - 云”协同框架,分享客户端与服务端开发过程。还探讨用Agent架构和FaaS的原因,指出其在应对需求变化、节省成本等方面优势,最后提及项目待优化处。

阿里云开发者
产品应用8

LLM 技术在有道词典笔上的应用实践

本文围绕LLM技术在有道词典笔的应用展开。先分析端侧大模型落地挑战,如算力、功耗等。介绍有道词典笔等硬件及应用,对比端侧与云侧AI优劣。还阐述模型落地模式、算法优化及“子曰3数学模型”开源情况。

InfoQ
算法论文8

EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!

近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。

深度学习自然语言处理
新闻资讯8

用 Astra+Codex 干掉 CUDA!奥特曼9个月AI造芯反杀英伟达 GB300

北京时间昨日凌晨,OpenAI 公布自研推理芯片 Jalapeño 实测结果,其在多指标挑落英伟达 GB300。OpenAI 用 GPT - 6 和加强版 Codex 造芯,9 个月完成硬件设计优化,3 个月搞定软件栈,威胁英伟达 CUDA 根基。

AI前线
新闻资讯8

微软刚发布Mu模型:支持Windows智能体,小参数跑出10倍性能

今天凌晨微软发布创新小参数模型Mu,3.3亿参数性能比肩Phi - 3.5 - mini,体量小10倍,离线NPU笔记本每秒超100 tokens响应。它支持Windows智能体,架构有多项创新,经训练优化后智能体表现出色。

AIGC开放社区
新闻资讯8

浙江,冲出一匹碳化硅芯片全球黑马!

在‘双碳’目标与数字中国建设蓝图下,电能管理机遇巨大。黄兴博士指出将供电架构优化为高压直流可降低能耗,关键在于碳化硅功率芯片。其创办的派恩杰半导体,自主研发芯片,从芯片到封装助力客户,迎来产业机遇。

芯师爷