Adam优化器」共找到 1419 篇相关文章

开源动态8

本地运行、支持视觉与工具调用:Meta 开源智能体模型

Meta AI Research 推出 300 亿参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可证。它专为本地工作流设计,能在消费级硬件运行,经多项优化,在基准评估中表现出色,还支持多种框架。

AI前线
新闻资讯8

【万字长文】Anthropic发布Prompt Engineering全新指南

Anthropic发布全新Prompt Engineering指南,涵盖元提示、模板等关键技术。介绍了prompt类型、必备要素,还给出优化技巧,如添加示例、思维链精炼等,涉及XML标签、链式提示等方法,也提及减少幻觉、提高一致性等内容。

CourseAI
开源动态8

SmolVLA: 让机人更懂 “看听说做” 的轻量化解决方案

文章介绍轻量级开源视觉 - 语言 - 动作 (VLA) 模型 SmolVLA,专为机人领域设计,可在消费级硬件运行。它用公开数据集训练,架构经优化,还引入异步推理堆栈,性能超部分大模型,降低研究门槛。

Hugging Face
开源动态8

华为| 祭出FlashComm1,FlashComm2、FlashComm3,解决LLM推理通算瓶颈

在大模型推理面临通算难题背景下,华为数学家祭出FlashComm 1、2、3。如FlashComm 1优化AllReduce通信,提升推理性能;FlashComm 2重构计算流程,提升推理速度;FlashComm 3实现多流并行,激增模型吞吐。

AINLPer
新闻资讯7

DSpark推理速度提升80%后,OpenAI宣布新方法将推理成本降低了一半

近日,OpenAI 工程师开发优化技术,将模型推理成本降一半。业内猜测或基于公开成果,也有人认为是模型量化。此前 DeepSeek 推出 DSpark,使 V4 模型推理速度提升 60%-85%,还引入峰谷定价机制。

AI科技评论
产品应用8

自媒体误读了 DeepSeek-OCR:一图胜千言

近期,DeepSeek-OCR引发关注,但很多媒体误读其为OCR工具,实际是视觉语言模型。它是为大文档等场景优化的视觉压缩与识别系统,架构新颖,训练讲究,效果出色,为行业带来新思路。

MacTalk
算法论文8

国产芯片比英伟达整体效率更高!?华为 CloudMatrix384 超节点首曝论文,跑 DeepSeek 效率超越英伟达

今年4月,网上曾争论华为芯片效率是否超国际主流。近日华为团队论文公开,阐述在CloudMatrix 384超节点部署DeepSeek大模型细节,性能指标超英伟达体系,还介绍架构、软件栈及适配优化方案。

InfoQ
产品应用8

破解300年数学难题,智能体大突破!谷歌发布超强AI Agent

今天凌晨谷歌Deepmind发布编程AI Agent——AlphaEvolve,它与Gemini深度集成,能评估算法。它解决了300多年的数学难题,还提出新算法,提升大模型计算效率,可优化GPU指令,架构含多模块。

AIGC开放社区
产品应用7

6个Claude Code神作,Anthropic亲选

Claude 官方晒出一批来自普通用户的 Claude Code 「神作」,覆盖实用工具、可视化创意和趣味应用等领域,如人脸涂鸦、医学影像查看、代码库动态图等。这些项目反映出 Claude Code 正走出传统编程场景。

机器之心
新闻资讯7

AI工具已成为史上最大流量入口?

作者白杨SEO看到一张称主流AI工具成史上最大流量入口的图,提出质疑。他指出数据存疑,AI用户使用量远不及搜索,商业化也不成熟,还对比国内外AI搜索优化GEO差异,认为企业要提前布局。

白杨SEO优化教程