小模型训练」共找到 8495 篇相关文章

算法论文8

警惕!大模型成本倒挂:你正在为模型的多余「思考」买单

一项来自多所高校和微软研究院的研究揭示AI模型价格倒挂现象,低定价模型可能产生更高实际开销。研究聚焦8个前沿推理模型和9个主流数据集,指出推理token是成本倒挂主因,且实际开销难以预测。

机器之心
开源动态7

从文心开源谈起,论大模型发展新生态

6月30日百度宣布开源ERNIE 4.5即文心4.5系列模型,实现预训练权重+推理代码完全开源。文心团队提出创新架构,增强多模态理解能力。今晚7:30,CSDN邀专家深度解读文心开源及行业趋势。

AI科技大本营
开源动态8

解码加速15倍!EdgeRazor助推大模型在PC/移动端“狂飙”

大语言模型参数膨胀,端侧部署难,量化成主流轻量化方案。开源工具库EdgeRazor由南京大学和微软联合推出,采用MPQAD打破极低比特大语言模型“能力塌陷”,在性能、效率、易用性等方面表现出色,打通AI全生态链路。

机器之心
新闻资讯7

“通用大模型微调成为行业模型是伪命题”?医疗 AI 深度重构,传神语联创始人何恩培:孪生智能体能砍 70% 线下复诊工作

本文为《2025年度盘点与趋势洞察》系列内容,传神语联创始人何恩培认为通用大模型微调成行业模型是伪命题。他表示孪生智能体能砍70%线下复诊工作,还分享了医疗AI发展、中医和西医落地方向及突破方向等见解。

AI前线
产品应用8

14K Star!统御万模的 AI 聚合网关,一个 API 管理所有大模型

文章分享了AI聚合网关神器New API,它基于Go和React开发,是中转分发系统,像超级转换插头。集成30+模型服务,有多种特性,支持6种部署方式,能收敛混乱的模型调用。

开源星探
算法论文8

一篇大模型Agentic框架到应用最新综述

这是首篇系统拆解“大模型Agentic推理框架”的综述,不聊训练,只聚焦如何把LLM组织成会思考、协作、调工具的Agent,横跨科学发现、医疗、软件工程、社会经济模拟四大战场,给出统一语言、视角和评测。

PaperAgent
产品应用7

DeepSeek R1 的更新,却大有深意?

5月28日,DeepSeek低调宣布R1模型版本试升级,API接口和使用方式不变,但未公布具体更新内容。从用户反馈看,语义理解、逻辑推理等能力提升,实测表现出色。此次升级或有安全、产品路线等考量。

AGI Hunt
开源动态8

Hugging Face 推出 GOLD:让不同模型家族也能做知识蒸馏

Hugging Face研究团队提出GOLD方法,解决了知识蒸馏中老师和学生模型需用同一套分词器的痛点,让不同模型家族间也能做知识蒸馏。它通过三步解决跨分词器蒸馏,实验效果良好,已集成到TRL库。

AI工程化
开源动态7

最强DeepResearch!通义DeepResearch-30B开源实战:模型部署+LangGraph+A2A全攻略

阿里发布全开源项目通义DeepResearch,在研究任务评测中表现出色,底层是30B的MoE专用推理模型,资源需求低。文章演示了基于该项目构建本地化端到端DeepResearch助理的方法,包括模型部署、Agent实现等。

AI大模型应用实践
算法论文8

最新视觉大模型 DINOv3论文精读(逐段解析)

DINOv3是突破性自监督视觉基础模型,其创新围绕数据与模型协同扩展、Gram锚定技术、多阶段训练策略。它解决传统自监督学习难题,在多任务上无需微调达最优,为计算机视觉树立新标杆。

机器学习AI算法工程