四段式预训练」共找到 2355 篇相关文章

新闻资讯7

寒武纪,成为“寒王”之后

寒武纪由天才兄弟创立,曾给华为提供NPU技术,后转型推出思元系列芯片。2024年季度首盈,2025年业绩起飞、股价超茅台。但它依赖单一客户、内外竞争大、开发者生态不完善,问题交织难短时间解决。

芯师爷
开源动态7

实时交互式长视频生成

文章提出用于实时交互式长视频生成的帧级自回归框架 LongLive,解决了长视频生成在效率和质量方面的挑战,具备长视频生成、实时推理、高效微调等亮点,还给出安装、推理、训练等步骤。

GitHubStore
开源动态7

刚刚,LeCun团队开源首款代码世界模型!能像程序员一样思考的LLM来了

Meta官宣发布代码世界模型CWM,将世界模型引入代码生成任务。它基于编程和世界建模数据训练,能模拟程序执行与交互。在编程基准测试中表现不错,算是Meta的概念验证,目前可看作Demo。

新智元
算法论文8

DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免训推理加速61倍

扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。

机器之心
新闻资讯8

中国AI芯片大突围,DeepSeek V3.1引爆算力革命

DeepSeek V3.1发布,是中国AI技术自主性的战略突围。它有6850亿参数,采用UE8M0 FP8适配国产芯片,具混合推理架构、Agent能力等。其发布或重塑AI产业格局,推动国产芯片发展。

AIGC开放社区
开源动态8

快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!

快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。

AI前线
算法论文8

从繁杂技巧到极简方案:ROLL团队带来RL4LLM新实践

当前RL4LLM领域发展快但存在标准、结论不一及机制解释不足等问题。阿里巴巴淘天集团和爱橙科技联合高校基于ROLL框架研究,评估关键技术组件,提出简化算法Lite PPO,在多基准上表现佳。

机器之心
开源动态8

谷歌开源Gemma 3 270M,性能超越Qwen 2.5同级模型

本周,谷歌发布 Gemma 3 270M 模型,它参数小、功能强,具备指令跟踪等能力。在 IFEval 测试中表现出色,节能且适合多场景,谷歌还提供使用指南和试用途径,Gemma 系列下载量已破两亿。

机器之心
推荐文章7

AI 产品定价指南:按量定价的卡点到底是什么?

本文编译 a16z 与 Scott Woody 访谈,探讨 AI 改变软件定价逻辑及企业应对策略,还补充定价专家 Madhavan Ramanujam 关于 AI 产品定价象限观点,指出按量定价的难点、适用模式及企业转型要点等。

Founder Park
新闻资讯7

苹果向英伟达生态妥协了!MLX框架主动适配CUDA

苹果特意为端侧AI模型训练推出的MLX框架,主动增加了CUDA支持。因CUDA在AI开发领域占主导,且生态强大,苹果此举是借力英伟达生态、扩大自身影响力的战略选择,也避免侵权。

量子位