生成式预训练」共找到 4004 篇相关文章

开源动态8

CapRL:用强化学习突破Image Captioning训练瓶颈,3B模型性能媲美72B

上海人工智能实验室联合团队发布 CapRL,首个将 DeepSeek - R1 强化学习策略用于 Image Captioning。CapRL - 3B 模型在图像描述任务媲美 Qwen2.5 - VL - 72B,已开源,团队持续迭代优化。

OpenMMLab
产品应用7

训练大模型玩《反恐精英》:自带外挂一枪爆头,堪比职业玩家

动视暴雪、斯坦福大学和英伟达等研究人员基于职业玩家游戏数据和Transformer架构,开发游戏大模型MLMOVE。在《反恐精英:全球攻势》测试中,它表现出色,性能超现有机器人,还具提前预判移动等创新。

AIGC开放社区
产品应用7

GPT-Image2提示词:瞬间拥有顶级字体美学

文章介绍了利用GPT - Image2生成顶级字体美学图像的提示词。创意源于博主「小小东」,作者也打磨了自己的提示词。详细阐述了提示词使用方法、生成图像的各项要求,如文字突出、风格自适应等。

AI寒武纪
新闻资讯7

Cursor滑跪开源技术报告:Kimi基模这样微调能干翻Claude

Cursor放出Composer 2技术报告力证‘自研’,基于Kimi K2.5经持续预训练和异步强化学习,测试表现好。同时,杨植麟分享Kimi团队最新思考,认为大模型要规模化,断言大模型训练进入第三阶段。

量子位
算法论文7

翁荔陈丹琦加盟的840亿AI公司,公开第二篇论文

明星创业公司Thinking Machines公开第二篇研究论文,主题为“Modular Manifolds”,通过统一框架约束和优化网络不同层/模块,提升训练稳定性与效率。论文提出模块化流形思路,若应用于大模型,训练效率和稳定性将大幅提升。

量子位
新闻资讯8

李飞飞3D世界模型公测,网友已经玩疯了

今日李飞飞创立的World Lab推出全新3D世界生成模型Marble并开启公测。普通人能靠文本等生成专属3D世界,还能在VR体验。它功能强大,未来将重点发力交互性。

量子位
开源动态8

Qwen-Scope:看穿大模型的“小心思”

Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。

千问大模型
算法论文8

10步优化超越强化学习,仅需1条未标注数据!后训练强势破局

无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。

新智元
新闻资讯8

Ilya交卷!黄仁勋砸50亿押注SSI,首个模型疑本周发布

Ilya Sutskever创立的SSI或本周发布首个重磅模型,引发圈内关注。英伟达砸50亿美元合作,提升其算力。该模型基于测试时训练架构,能边学边进化,或终结大模型“预训练时代”。

新智元
新闻资讯7

AI 大牛刘威创业公司完成 5000 万美元融资,12 月将发布新模型

当地时间11月5日,刘威创立的Video Rebirth完成5000万美元种子轮融资,用于打造视频生成模型。公司计划12月发布Bach模型及AI视频生成平台,将与OpenAI Sora竞争,虽对手强大,但刘威认为小团队有机会。

AI前线