零预训练」共找到 2461 篇相关文章

新闻资讯8

英伟达4B小模型击败GPT-5 Pro!成本仅1/36

英伟达ARC - AGI 2中,4B小模型NVARC以27.64%成绩力压GPT - 5 Pro登顶,单任务成本仅其1/36。亮点是零预训练深度学习法,还靠合成数据、测试时微调等策略。小模型特定领域优化后优势明显。

量子位
算法论文8

SceneSplat: 基于3DGS的场景理解和视觉语言训练,让3D高斯「听懂人话」的一跃

文章引入 SceneSplat,首个在 3DGS 上原生运行的端到端大规模 3D 室内场景理解方法,提出自监督学习方案,构建发布 SceneSplat - 7K 数据集,在多个实验中达 SOTA 效果。

机器之心
新闻资讯8

李飞飞团队发布新一代世界模型Atlas:从训练,一次性打通视频生成、 3D重建与机器人仿真

李飞飞创办的 World Labs 发布新一代世界模型 Atlas,称其为‘全球首个多模态世界模型’。它从训练,能同时完成视频生成、3D 重建和时空模拟,已向少数伙伴开放测试,未来将成 Marble 底层模型。

DeepTech深科技
算法论文8

Depth Anything再出新作!浙大&港大出品:样本,优化任意深度图

浙江大学与港大团队推出「Prior Depth Anything」,融合深度传感器数据与AI深度图,一键补洞、降噪、提分辨率。无需额外训练,可提升3D模型深度质量,样本刷新多项深度处理纪录。

新智元
算法论文8

VAE时代终结?谢赛宁团队「RAE」登场,表征自编码器或成DiT训练新基石

纽约大学谢赛宁团队推出RAE替代VAE,解决了DiT依赖旧版SD - VAE的问题,如架构复杂、潜空间受限等。RAE结合训练编码器和解码器,还提出DiT^DH变体,实验效果好,网友看好其前景。

机器之心
新闻资讯8

GTC 巅峰对话 Jeff Dean x Bill Dally:训练范式已死、延迟瓶颈不在计算、谈透 AI 五年未来 | GTC 2026

GTC 2026上,NVIDIA首席科学家Bill Dally和Google Jeff Dean展开重磅对话。讨论了模型能力进步、低延迟推理架构、模型自主进化、数据与算力、训练与推理硬件差别等多方面内容,分享对未来AI的看法与见解。

AI科技大本营
开源动态8

阿里Qwen3技术报告核心要点解读!

阿里Qwen3技术报告发布,披露模型架构、训练及后训练等技术细节。其有密集与混合专家两种模型架构,训练数据量和语种增多,后训练采用强到弱蒸馏提升性能,各模型表现优异。

PaperAgent
开源动态7

Meta没做的,英伟达做了!全新架构吞吐量狂飙6倍,20万亿Token训练

英伟达发布全新架构9B模型NVIDIA Nemotron Nano 2,以Mamba - Transformer混合架构实现推理吞吐量最高提升6倍,对标Qwen3 - 8B并在多任务中表现持平或更优,还开源模型及大部分训练数据。

新智元
开源动态7

开源播客TTS神器!高效TTS模型:Muyan-TTS,0.33秒生成1秒音频,样本语音合成!

介绍新发布的开源TTS模型Muyan - TTS,它专为播客场景设计,以超低延迟实现样本语音合成,训练大量播客数据,支持长内容连贯生成,还介绍了使用步骤、适用场景等。

开源星探
开源动态8

一键式训练端到端Agent,Qwen3+MCP工具集高效集成!

RLFactory是开源的端到端RL后训练框架,将环境与训练解耦,用Qwen3基座调用MCP工具集,可低代码训练端到端Agent模型。它极致易用、训练高效,还支持一键式训练,未来会更易用高效。

深度学习自然语言处理