大模型存储」共找到 9268 篇相关文章

新闻资讯7

27、42、73,DeepSeek这些模型竟都喜欢这些数!为什么?

技术作家发现GPT - 4o、Claude等模型猜数偏好42、73,Andrej Karpathy测试中模型多选27。网友猜测原因,如数据集、人类偏见等,也有论文分析此现象,多与数据分布有关。

机器之心
新闻资讯7

存储厂预告净利或增520%,行业“超级周期”来了?

1月13日晚,佰维存储发布业绩预告,预计2025年营收、净利润幅增长,扣非净利润同比增超10倍。这或宣告存储行业严冬终结。背后是市场供需重构,芯片涨价波及下游,2026年市场将迎“新常态”。

芯师爷
新闻资讯7

国产存储芯片抢抓“超级周期”机遇

自今年第三季度起,存储芯片行业进入‘超级周期’,海外厂产能向高端转移造成中端供给缺口。本土存储芯片厂商完善中低端布局、量产产品、取得高端进展,有望填补空白、提升话语权。

芯师爷
新闻资讯8

新鲜出炉!斯坦福2025 CS336课程全公开:从零开始搓模型

斯坦福学2025年春季CS336课程“从头开始创造语言模型”课程和材料全公开。介绍了讲师信息,课程目标是引导学生开发语言模型,含5单元19门课,注重实践,还说明了学习该课程需具备的能力。

机器之心
推荐文章8

人工智能研究者如何意外发现:我们对“学习”的理解,可能全是错的

传统理论认为模型会过拟合,而如今模型却驱动了诸多应用。2019年研究者突破传统扩模型规模,出现‘双下降’现象。‘彩票假说’解释其成功原因,还重新定义了‘智能’,揭示科学进步规律。

宝玉AI
开源动态8

性能涨!阿里开源新版Qwen3模型,霸榜文本表征

今日凌晨阿里开源Qwen3-Embedding和Qwen3-Reranker两款新模型,专为文本表征等任务设计,支持119种语言。测试显示其性能出色,在多语言文本表征和排序任务中超越众多模型,还采用了多种创新设计与训练方法。

AIGC开放社区
算法论文8

让LLM扔块石头,它居然造了个投石机

港中研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。

量子位
算法论文8

Learning from peers!让LRM互相「传纸条」的新协作方式幅提高准确率和效率

当前主流模型如QwQ - 32B存在“前缀主导陷阱”,推理开头出错会使准确率暴跌。研究者受“同伴互助”启发提出LeaP框架,设计三种路由策略,实验显示小模型能借此超越模型,开创了多种可能性。

深度学习自然语言处理
开源动态7

这个框架让模型省下50%内存,合并专家不如直接删掉?

Cerebras Research提出REAP框架,通过专家剪枝和合并技术压缩SMoE模型,能让模型‘瘦身’并保持性能,可省50%内存,但社区测试有不同结果,且存在调度开销等问题。

AI工程化
新闻资讯7

辍学潮来了?19、20 岁年轻人“逃离”教室去 AI 创业,20 多年创业佬断言:他们的机会比

存储公司 Box 创始人 Aaron Levie 分享创业经验与 AI 见解。他指出 AI 让初创公司机会增,巨头优势不再,年轻创业者将成长为新厂,还分析了云计算与 AI 转型差异等。

InfoQ