大模型预训练」共找到 9494 篇相关文章

开源动态8

开源打破“AI黑箱”!集结全球咖,GOSIM Paris 2026带你看懂Agent时代变局

GOSIM Paris 2026在巴黎举办,是面向开发者的开源AI技术会。会由GOSIM主办,CSDN等联合打造,聚焦AI能力落地应用。首日Keynote多位咖探讨AI相关问题,还有三论坛、工作坊、Hackathon等活动。

AI科技大本营
推荐文章8

62岁软件教父Martin Fowler警告:AI泡沫下,裁员潮印证行业萧条,模型正将编程拖入“非确定性深渊”!

62岁软件教父Martin Fowler在The Pragmatic Engineer节目中谈AI对软件开发的影响。他认为当下行业萧条,AI有泡沫,编程从确定性转向非确定性带来挑战,也催生新工作流程,还强调测试、重构等的重要性。

InfoQ
开源动态8

AI 领域新动向!持续思考模型CTM横空出世:AI 向生物智能迈出重要一步

Sakana AI 推出新型 AI 模型 CTM,重新引入「时间」和「神经元动态」到 AI 计算核心。它有诸多创新,在迷宫探索、图像识别等任务表现出色,虽有训练慢等不足,但为 AI 向生物智能迈进提供新思路。

AI寒武纪
开源动态8

训练时间减半,性能不降反升!腾讯混元开源图像生成高效强化方案MixGRPO

混元基础模型团队提出全新框架MixGRPO,结合SDE和ODE,简化MDP优化流程,提升效率与性能。还推出更快变体MixGRPO - Flash。MixGRPO训练时间降近50%,MixGRPO - Flash再降71%,效果和效率优于DanceGRPO。

量子位
算法论文8

打破「数据暴力」预训练惯性,阿里Qwen、上交等提出预训练动态数据选择范式OPUS

阿里Qwen、上交等团队提出预训练动态数据选择范式OPUS,打破“数据暴力”预训练惯性。它将数据选择与优化器更新轨迹对齐,提升预训练效率与下游泛化表现,实验显示其“效率+性能”双提升。

机器之心
开源动态8

让视觉语言模型像o3一样动手搜索、写代码!Visual ARFT实现多模态智能体能力

上海交等团队推出多模态智能体训练方法 Visual-ARFT,让视觉语言模型有「工具智能体」能力,还开源项目。它能自动调用工具、拆解任务,团队构建 MAT-Bench 评测,其在多任务超 GPT-4o。

机器之心
开源动态8

社区供稿丨MiniCPM-V 4.5 技术报告正式出炉

上个月开源的多模态模型 MiniCPM-V 4.5 广受好评,今日其技术报告出炉。报告从架构、数据和训练三方面探索高效路径,提出三技术,使模型在多任务上突破,小参数规模下性能和推理速度佳。

Hugging Face
新闻资讯8

姚顺雨对着唐杰杨植麟林俊旸贴脸开讲!基模四杰中关村论英雄

清华发起AGI - Next前沿峰会,智谱唐杰、Kimi杨植麟、阿里林俊旸、姚顺雨等咖齐聚。他们探讨AI发展方向,如唐杰认为Chat阶段结束,应走向做事;杨植麟强调做模型要创造世界观;林俊旸介绍千问进展,还讨论了路线分化、自主学习等话题。

量子位
开源动态8

百度0.9B参数模型登顶全球第一,聊聊PaddleOCR-VL背后的技术细节

百度PaddleOCR-VL模型仅0.9B参数,在OmniDocBench V1.5榜单获92.6分全球第一,在多能力维度达业界最佳,能处理109种语言。其采用两阶段架构,结合优质训练数据,实现高性能与低内存、快速度的平衡。

AIGC开放社区
新闻资讯7

16岁创业,22岁做成百亿独角兽!3位高中同学帮厂训AI年入1亿美金

Meta豪掷143亿收购Scale AI,其CEO加盟Meta。这一并购让Mercor创始人Brendan Foody看到机会,认为Scale AI失去中立性,厂或不再合作。Mercor为AI实验室提供训练人员,年入1亿美金,估值达百亿。

新智元