全量微调」共找到 2574 篇相关文章

新闻资讯7

黄仁勋要发Token当工资!硅谷兴起刷大赛,一人一周烧掉33个维基百科

硅谷兴起Tokenmaxxing(Token刷大赛),AI公司追踪员工token消耗,招聘、考核都与token相关。风投者费用半年内从月付200美元涨至年烧10万。黄仁勋提议用token作薪酬,同时也有对刷竞赛的质疑。

量子位
算法论文8

微调已死?Agentic上下文工程登场,无需微调实现模型进化

斯坦福大学等团队提出 Agentic Context Engineering 技术,让语言模型无需微调自我提升。它将上下文视为作战手册,引入三种协作角色与三项创新,实验显示其在两类任务上表现优异,成本和延迟显著下降。

机器之心
算法论文8

NUS LV Lab新作|FeRA:基于「频域能」动态路由,打破扩散模型微调的静态瓶颈

在大模型时代,参数高效微调(PEFT)已成为迁移大规模扩散模型至下游任务的标准范式。但现有微调方法多采用「静态」策略,忽略扩散生成过程内在规律。新加坡国立大学LV Lab等机构提出FeRA框架,通过频域能动态路由,实现高效微调

机器之心
新闻资讯8

谷歌AGI底座降临!首个原生模态嵌入模型上线,已实现模态SOTA

谷歌发布首个原生模态 Embedding 模型 Gemini Embedding 2,将文本、图、音视频及 PDF 融于统一向空间,实现跨模态检索,降低架构成本,赋予 AI 连贯「记忆」,是重塑 AI 基建的里程碑。

新智元
新闻资讯7

HF Papers 直播 AI Insight Talk| Omni模态专场

由多平台联合发起的【AI Insight Talk】系列直播活动第五场 - Omni模态大模型专场于2025年11月18日10:00 - 12:00直播。多位模态模型核心研发者将分享技术,还有圆桌对谈。

Hugging Face
开源动态8

刚刚,美团开源模态龙猫模型,和 ChatGPT 大战 100 回合打得难解难分

美团发布开源模态 MoE 模型 LongCat-Flash-Omni,参数 560B 激活 27B。它有真正模态能力,采用创新架构和训练范式,基准测试表现亮眼,部分指标超 Gemini-2.5-Flash,引发网友热议。

AGI Hunt
推荐文章8

可复制的 AI Coding 栈实战:比 OpenSpec 更轻、更丝滑

本文整理自淘宝闪购邓立山在 QCon2026 北京站演讲,分享其团队一年多 AI 编码栈实战经验,分析 AI 编码问题,提出解决方案,介绍方案演进、实战案例及推广情况,还探讨了未来演进方向。

InfoQ
算法论文8

75%预训练数据都能删!Jeff Dean新作:自动筛除低质数据

Google DeepMind团队开发的DataRater可自动评估数据质,用元学习筛选有价值数据,提升模型训练效率。它能减少计算、提高性能,在低质数据集效果佳,还能跨模型规模泛化。

新智元
推荐文章8

AIGC生命周期业务风控白皮书,从备案到运营的合规与安实践

2025年9月15日《人工智能安治理框架》2.0版发布,为AI风险防控指明方向。数美科技发布《AIGC生命周期业务风控白皮书》,构建生命周期业务风控体系,涵盖合规备案、安评测、账号与内容风控等多方面。

AI前线
算法论文8

微调重要表征以增强思维链的推理能力

团队提出关键表征微调(CRFT)方法,通过信息流分析识别和优化关键表征。在八个数学和常识推理基准及两个模型系列验证其有效性,能提高推理准确率,学习参数低,还适应少样本场景。

深度学习自然语言处理