零预训练」共找到 2476 篇相关文章

新闻资讯8

中国AI芯片大突围,DeepSeek V3.1引爆算力革命

DeepSeek V3.1发布,是中国AI技术自主性的战略突围。它有6850亿参数,采用UE8M0 FP8适配国产芯片,具混合推理架构、Agent能力等。其发布或重塑AI产业格局,推动国产芯片发展。

AIGC开放社区
开源动态8

快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!

快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。

AI前线
算法论文8

从繁杂技巧到极简方案:ROLL团队带来RL4LLM新实践

当前RL4LLM领域发展快但存在标准、结论不一及机制解释不足等问题。阿里巴巴淘天集团和爱橙科技联合高校基于ROLL框架研究,评估关键技术组件,提出简化算法Lite PPO,在多基准上表现佳。

机器之心
新闻资讯7

苹果向英伟达生态妥协了!MLX框架主动适配CUDA

苹果特意为端侧AI模型训练推出的MLX框架,主动增加了CUDA支持。因CUDA在AI开发领域占主导,且生态强大,苹果此举是借力英伟达生态、扩大自身影响力的战略选择,也避免侵权。

量子位
新闻资讯7

Kimi新模型数学反超DeepSeek!北大校友刘征瀛等领衔

Kimi新定理证明模型超越DeepSeek,基于Qwen2.5 - 72B打造,采用Kimi k1.5强化学习训练流程。有两大技术创新,还有精简版本,官方有Demo。双方此前比赛就打得有来有回。

量子位
开源动态7

香港科技大学、Manycor开源空间大模型,超3000颗星

香港科技大学、Manycore联合开源空间大模型SpatialLM,用于处理3D点云数据。它结合点云特征提取、对齐和语言生成,实现高效转换。研究团队经多种尝试选定基于点的方法及Sonata编码器,还选Qwen2.5 - 0.5B为基础模型。

AIGC开放社区
算法论文8

0%通过率!Code神话泡沫!LiveCodeBench Pro发布!

国际算法奥赛金牌得主团队测试20个顶级大模型,在584道编程赛题上,高难度题目AI通过率为0%。论文发布LiveCodeBench Pro评测方法,揭示AI编程能力神话泡沫,指出其问题并给出提升方向。

深度学习自然语言处理
推荐文章7

大概念模型:AI 推理的新范式

大概念模型(LCM)是自然语言处理新范式,侧重结构化推理和理解,与 LLM 不同。它依赖结构化知识,可模拟专家思维,解决当前 AI 缺陷,文章还介绍其架构、应用、局限,探讨与 LLM 结合的未来发展。

InfoQ
推荐文章9

刚写完V4.1主算子就要“转业”?DeepSeek资深算子工程师深夜独白

本文整理了DeepSeek资深MLSys工程师刘胜与的公开长文,刘胜与刚交付DeepSeek V4.1核心算子,就判AI将很快超越人类算子开发能力,分享职业转型思考与行业警示,引发技术圈热议。

AI前线
新闻资讯8

4000 万美金新一轮融资,ACE 成为 AI 音乐赛道融资额最高的华人团队

近日,AI音乐公司ACE完成近4000万美元新一轮融资,成AI音乐赛道融资额最高的华人团队。它自己训练音乐基础模型与做应用,构建数据飞轮,还推出新消费级产品Miya,欲打造AI时代的Spotify。

Founder Park