全量微调」共找到 2583 篇相关文章

产品应用8

上海AI实验室发布『书生』具身栈引擎,推动机器人大脑进入产时代 | WAIC 2025

上海AI实验室发布『书生』具身栈引擎Intern - Robotics并开放,它有一脑多形、虚实贯通、训测一体等创新。还启动‘具身智能光合计划’,15家企业机构已加入,助力解决行业难题,推动具身大脑产。

OpenMMLab
算法论文8

RL训练一层就够了!单层RL超越参数训练,跨任务跨模型跨算法部验证

明尼苏达大学、北大和亚马逊团队研究发现,RL收益集中在中间层,训练单层可超参数训练。他们提出层贡献度指标,经多模型、算法、任务实验验证,还给出三种训练优化策略。

机器之心
开源动态8

谷歌Gemma 4系开源:3.8亿激活超越20倍体模型,手机秒变AI工作站

谷歌发布Gemma 4系列开源模型,有4个尺寸。它在硬件适配、注意力机制等方面革新,能在手机等设备运行,在测试中成绩出色,还获多平台支持,谷歌发起挑战赛鼓励开发者。

AIGC开放社区
算法论文8

AI看图一本正经胡说八道?「一拉一推」让模型看得又准|微软x清华

随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看又准’,实验效果显著。

量子位
开源动态8

Karpathy再放大招:8000行代码复现ChatGPT栈,最低成本仅100美元,4小时跑完

Andrej Karpathy发布项目nanochat,是栈式ChatGPT克隆体训练/推理流水线,代码约8000行,覆盖训练分词器、预训练等完整流程。介绍不同成本下模型表现,还回答网友关于架构、训练数据等问题。

AI寒武纪
开源动态8

打破数据质鸿沟!清华腾讯Bee项目发布1500万高质数据集,刷新MLLM栈开源SOTA

开源多模态大模型性能被闭源和半开源模型“卡脖子”,根源在于数据质。清华与腾讯混元团队推出Bee项目,有三大核心贡献,产出的Bee - 8B模型表现领先,证明保证数据质比堆更有效。

量子位
7

Claude用户退订潮!被指高峰期偷换缩水模型,工程师列9大罪状呼吁网退订

Claude出现大危机,AI工程师带头呼吁退订,列9大罪状,如高峰时段偷换缩水模型等。不少用户退订,转投OpenAI Codex,其使用激增。这也让国产模型等获更多尝试,CLI AI编程模式受重视。

量子位
新闻资讯7

Google链路赋能出海:3人团队调度千个智能体,可成独角兽|MEET2026

子位MEET2026大会上,Google Cloud大中华区负责人Dennis Yue称智能体为初创出海注入新内涵。谷歌推一体化方案链路赋能,还谈到Gemini 3突破、A2A协议及商业模式转变等。

量子位
开源动态8

LLaVA-OneVision-1.5流程开源,8B模型预训练只需4天、1.6万美元

灵感实验室团队联合 LMMs - Lab 推出 LLaVA - OneVision - 1.5,流程开源。其 8B 模型预训练 4 天、成本 1.6 万美元,在多模态基准上性能优,还公开数据构建与训练策略等细节,复现简单。

机器之心
产品应用8

上海AI实验室发布 Intern Lumina U2:离散扩散建模,让模型既能“看懂”也能“生成”

上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。

OpenMMLab