「多模态推理大模型」共找到 8262 篇相关文章
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。
扒一扒Meta全新大模型Muse Spark里藏着的PDR技术
Meta发布闭源大模型Muse Spark及‘沉思模式’,背后藏PDR推理技术。该技术通过‘并行起草+精炼’突破性能瓶颈,对比传统长CoT范式优势明显,在AIME竞赛题目测试中准确率显著提升。
阿里开源DeepResearch模型,超强“AI研究员”,开启自主智能体新纪元
阿里巴巴通义实验室开源Tongyi DeepResearch模型,是全球首个性能能与OpenAI DeepResearch较量且全开源的Web Agent。它采用先进架构,有两套推理范式,训练方法论有创新,实测表现佳,应用场景广,用Apache - 2.0许可证。
多模态后训练反常识:长思维链SFT和RL的协同困境
华为与香港科大研究发现,多模态视觉语言模型中,长思维链SFT与RL组合难协同增益。研究引入难度分类方法构建数据集,分析各方法表现及组合策略困境,还给出实验发现与未来研究方向。
Claude 小升级就赢了OpenAI 9年“开源神作”?高强度推理直接歇菜、幻觉率高达50%,写作还被Kimi 2吊锤?
OpenAI发布首个开源语言模型系列gpt - oss,包括gpt - oss - 120b和gpt - oss - 20b,可在Hugging Face下载。同期谷歌、Anthropic也有新模型推出。gpt - oss有亮点,但也存在幻觉率高、实测效果差等问题。
24张图,从GPT-2到gpt-oss,看OpenAI开源模型技术演进
2025年8月OpenAI释出gpt-oss-20b与gpt-oss-120b两个开源权重模型。文章梳理了从GPT - 2到gpt - oss的技术演进,拆解关键创新点,对比了与Qwen3的差异,介绍训练推理细节、实测体验及与GPT - 5跑分对比情况。
同时监督和强化的单阶段大模型微调,告别“先背书再刷题”,推理泛化双提升|中科院&美团等
中国科学院自动化研究所联合美团提出单阶段监督 - 强化微调方法 SRFT,结合监督微调与强化微调,解决传统两阶段方法的不足,在多任务中提升推理和泛化能力。
“最强编码模型”上线,Claude 核心工程师独家爆料:年底可全天候工作,DeepSeek不算前沿
Anthropic 开发者大会发布 Claude 4 ,含 Opus 4 和 Sonnet 4 型号,在基准测试表现出色。核心工程师预测年底软件工程智能体能力,谈 RL 及 DeepSeek,还提到模型自我意识、推理计算瓶颈等问题。
DeepSeek-V3再发论文,梁文锋署名,低成本训练大模型的秘密揭开了
DeepSeek 发布围绕 DeepSeek-V3 的技术论文,从硬件架构和模型设计双重视角,探讨实现经济高效的大规模训练和推理的方法。介绍了 DeepSeek-V3 的创新设计,如 DeepSeekMoE 架构、MLA 架构等,还给出未来硬件架构设计建议。
大语言模型高考数学拿高分靠强化学习,那文科考高分得靠什么?
大语言模型在高考数学拿高分靠强化学习,但文科题无标准答案,此方法行不通。豆包1.6系列高考文科全科获683分,靠训练数据、思维链、长上下文和多模态直接读图等因素。