DeepSeek-R1-Distill-Qwen-1.5B」共找到 2447 篇相关文章

新闻资讯7

谷歌技术报告披露大模型能耗:响应一次相当于微波炉叮一秒

大模型耗电舆论高,谷歌用数据还击。谷歌首席科学家称Gemini能耗低于预期,一年间能耗降至1/33,碳排放降至1/44。谷歌用更全面指标计算能耗,还从多方面优化使Gemini能耗降低。

量子位
开源动态7

Glyph:文本转图片解决长上下文困境,智谱把“DeepSeek-OCR”具像化了

传统 token 扩展方式遇算力成本天花板,DeepSeek 与智谱都想到让 AI“看”文字思路。智谱发布 Glyph 框架工程化实现此思路,将文本转图片处理,降低计算成本,有不错效果但也存在排版敏感等限制。

AI工程化
开源动态8

秋招超强助攻:零基础1小时上手GPT微调!全流程教程免费开源

新一年秋招季,岗位对AI能力要求提升。OpenAI发布新开源大模型GPT - OSS,博主Lorentz Yeung开源本地部署和微调训练GPT - OSS的教程,助零基础者上手,还介绍环境搭建、代码和训练前后效果对比。

新智元
新闻资讯7

彩讯股份 CEO 白琳:企业级AI正从技术热潮走向系统化落地

1月31日彩讯股份发布《企业级AI应用白皮书》,CEO白琳接受采访。指出企业级AI正从技术驱动转向应用落地,面临系统性挑战,白皮书梳理发展阶段、痛点与路径,还介绍了‘1+1+N’策略等。

InfoQ
开源动态7

110万美元悬赏!AMD发起全球战书:谁能打破DeepSeek与Kimi的推理速度极限?

AMD与GPU MODE联合发起2026线上黑客松,向全球发榜。挑战赛设110万美元奖池,分预选赛和决赛,要对核心GPU算子打磨、挑战明星模型,代码须可合并,给出了赛程安排及参赛方式。

AI科技大本营
开源动态8

最强开源搜索再升级,研究、预测能力实测超惊艳!

MiroMind团队发布新一代模型MiroThinker-1.7和MiroThinker-H1,定位为重型推理智能体。其研究能力强、推理可靠,还能生成网页报告。新版本升级显著,靠两项关键技术实现有效交互,且预测案例表现出色。

开源先锋
产品应用8

2.12页/秒,MinerU2.5太快了,1.2B硬刚腾讯、阿里

GPT - 4o等刷新OCR榜单,但产业界仍面临文档图像处理难题。MinerU2.5提出1.2B轻量级文档解析模型,采用创新解耦范式,在多基准测试表现出色,单卡吞吐快,还给出可借鉴创新点。

CourseAI
推荐文章8

一年成爆款,狂斩 49.1k Star、200 万下载:Cline 不是开源 Cursor,却更胜一筹?!

AI编程助手看似热门,实则多数亏本运营。Cline选择开源,允许用户自由组合LLM编程,个人免费,企业服务收费。它一年成明星产品,获49.1k Star、近200万下载,其创始人分享了产品理念、发展等多方面思考。

InfoQ
产品应用8

1/10成本、Opus 4.7级表现,Cursor甩出了性价比之王Composer 2.5

Cursor推出新模型Composer 2.5,成本仅为Claude Opus 4.7的1/10,性能几乎追平。它更智能,擅长处理长时任务,遵循复杂指令更可靠。未来一周使用额度翻倍,还宣布与SpaceXAI合作训练新模型。

机器之心
算法论文8

单卡即可微调大模型!内存占用仅1/8,性能依然拉满 | ICML 2025

基础大模型应用于下游任务时微调成本高,低秩适应(LoRA)方法虽降低成本,但性能不及全量微调。华中科技大学和香港中文大学团队提出GOAT框架,在25个多领域任务验证效果好,内存占用仅1/8。

量子位