多阶段训练」共找到 5963 篇相关文章

开源动态8

Suno最强开源对手来了!ACE Studio和阶跃星辰联合开源了一款音乐模型,20秒即可生成4分钟神曲!

ACE Studio和阶跃星辰联合开源音乐模型ACE - Step,参数量3.5B,结合种技术,支持语言风格音乐生成。20秒可生成4分钟歌曲,比传统模型快15倍,有种功能亮点,还介绍了上手步骤和应用场景。

开源星探
开源动态8

o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:图空间智能试金石

文章介绍了MMSI - Bench,这是用于评估MLLM图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用样真实数据。实验显示MLLM在图像空间推理有短板,还开发自动化错误分析流程助力改进。

量子位
新闻资讯7

499上门装龙虾的人,开始赚299卸载龙虾的钱了

OpenClaw(龙虾)付费部署火爆后,卸载业务也成大型产业链,遍布平台。因安全隐患、烧Token等问题,不少人选择卸载。商家服务分层、价格灵活,甚至还有人盯上教小朋友学龙虾的生意。

量子位
产品应用8

Vidu Q2的参考生视频,是AI视频参党的胜利。

作者分享使用Vidu Q2图参考生视频的体验,认为它是AI视频参党的胜利,是新工作流范式。Q2在一致性、表演能力和风格表现力上大幅进化,价格实惠,还推出APP,图参考生视频未来可期。

数字生命卡兹克
推荐文章8

重磅!翁荔最新Scaling Law深度洞察来了

北大毕业的前OpenAI高管翁荔(Lilian Weng)的《Scaling Laws, Carefully》值得一读。Scaling law是预训练预算表,能帮少烧错钱。文章探讨大模型训练预算分配,分析Kaplan和Chinchilla结论差异及数据稀缺问题。

PaperAgent
开源动态8

NVIDIA 开源 Live VLM WebUI:摄像头实时测试视觉语言模型

NVIDIA 开源 Live VLM WebUI,可让用户在本地用摄像头实时测试视觉语言模型。它基于 WebRTC 技术,能将摄像头视频流实时传输给模型,分析结果叠加在画面上,支持后端、平台及种模型。

AI工程化
算法论文8

NUS LV Lab新作|FeRA:基于「频域能量」动态路由,打破扩散模型微调的静态瓶颈

在大模型时代,参数高效微调(PEFT)已成为迁移大规模扩散模型至下游任务的标准范式。但现有微调方法采用「静态」策略,忽略扩散生成过程内在规律。新加坡国立大学LV Lab等机构提出FeRA框架,通过频域能量动态路由,实现高效微调。

机器之心
推荐文章8

Agent开始“自我进化”:会出题、会反思,还会自己长出新技能

文章围绕自进化Agent展开,介绍其概念、受重视原因及三大技术路线,涵盖各路线代表工作的特点、评估及对比,指出研究空白如总结者训练等,最后还介绍了基于Agentic AI的全链路数据助手Dola。

腾讯技术工程
开源动态8

4小时喜提专属 ChatGPT、卡帕西又整活!自曝Agent帮倒忙、手搓八千行代码,网友:跑完就当上机器学习工程师

特斯拉前AI总监安德烈·卡帕西发布开源项目nanochat,是极简全流程训练/推理工具链,可搭建简易版ChatGPT复现模型。花100美元最快4小时能训练出可对话模型,代码基本手写,网友热度高。

AI前线
开源动态8

100美元、仅8000行代码,复现ChatGPT,Karpathy:这是我写过的最疯狂的项目

特斯拉前AI总监Andrej Karpathy发布全新开源项目「nanochat」,是极简且完整的「从零构建ChatGPT」训练框架。不到12小时GitHub星标破4.2k。约8000行代码,花100美元、4小时就能训练出专属「小ChatGPT」。

Founder Park