「大模型数据」共找到 10063 篇相关文章
Meta 143亿挖角后的首个作品:Alexandr Wang 推出闭源模型,杨立坤点赞
沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,在多领域有应用潜力。不过闭源引争议,且在部分领域有短板。
NeurIPS 2025 | 蚂蚁CGM:图融合架构重塑代码大模型,探索非 Agent 新范式
在NeurIPS 2025上,蚂蚁将展示Code Graph Model (CGM)。它把代码库图结构集成到开源LLM,开启新范式,在代码库级任务上以非Agent方案登顶开放权重模型榜首,解决了复杂软件工程的Agent依赖难题。
性能不减,吞吐量提升6.4倍!英伟达用混合算子和架构定义小模型新标准
NVIDIA研究团队通过Nemotron - Flash系列模型,打破对‘深而瘦’架构迷信,修正缩放定律,用进化算法搜索混合算子、改进训练策略。该模型在性能、延迟和吞吐量上表现出色,远超同类产品。
社区供稿丨AgentCPM-Explore开源,4B 参数突破端侧智能体模型性能壁垒
清华大学、中国人民大学等联合研发的 AgentCPM-Explore 智能体模型开源,它基于 4B 参数,在深度探索类任务表现佳。有打破参数壁垒等亮点,还开源配套工具,提供应对小模型挑战方法,邀伙伴共建生态。
挑战扩散自回归统治!字节提出视觉生成第三种路线,让模型像人类一样边画边改
五一期间字节商业化技术团队研发出新一代视觉生成模型,其底层架构是全新的第三条路——生成精炼网络GRN。它能让AI像人一样边画边改,解决了现有模型的问题,在多项基准测试中刷新SOTA记录。
新手必看!强化学习入门指南 | 从RLHF、PPO、GRPO到RLVR,最后到训练推理模型
Unsloth团队发布强化学习教程,从吃豆人谈起,介绍RLHF、PPO、GRPO等概念,分享用GRPO训练推理模型技巧。涵盖强化学习基础知识,还给出Unsloth使用GRPO训练模型方法及奖励函数示例。
传统训练效率很低?我们靠 “给模型降噪” 重新审视长上下文建模难题
文章指出长上下文模型处理长文本时易受噪声干扰,提出新评估指标IG分数和“上下文去噪训练(CDT)”方法。实验表明CDT优于现有策略,经其训练的开源模型在长上下文任务中性能媲美GPT - 4o。
腾讯混元发布并开源图像模型 2.1,支持原生 2K 生图
9月9日深夜,腾讯发布并开源混元生图模型“混元图像2.1”,支持原生2K高清生图,综合能力领先。它在多方面升级,有诸多亮点,评估显示效果优,还同步开源文本改写模型,能满足多样视觉需求。
国产开源LLM大爆发,Qwen、Minimax、美团、腾讯~
近期国产开源LLM大爆发,Qwen3-VL家族新增模型,有技术亮点且可免费商用;MiniMax-M2为编码和代理任务打造;美团LongCat-Video、LongCat-Audio-Codec各有专长;腾讯混元世界 - 镜像用于3D几何预测。
MiniMax重磅开源M1模型:百万上下文超DeepSeek R1,实现性能与效率双杀
MiniMax正式开源首个推理模型M1,原生支持百万级上下文长度,在推理效率、计算成本和复杂任务能力上有独特表现。其在性能和效率上超越DeepSeek R1等模型,还提出创新强化学习算法。