多模态输出」共找到 1196 篇相关文章

算法论文8

如何将LLM的"思考习惯"迁移到视觉领域?

传统多模态模型处理复杂视觉推理能力不足,OVR团队以Qwen2.5 - VL - 7B为基础构建开源强化学习框架,成果模型OVR在12个基准测试刷新记录,揭示认知行为跨模态迁移三条黄金定律。

深度学习自然语言处理
产品应用8

Qwen3.8-Flash:全新架构,更强更稳更划算

本文介绍了 Qwen3.8-Flash 多模态 MoE 模型,它原生支持 262,144 token 上下文。该模型在 Attention、Residual、Embedding 与 Optimization 四个方面系统升级,降低训练与推理成本,即将上线千问 AI 平台。还发布了 Qwen3.8-Flash-Next 开源权重。

千问大模型
产品应用8

豆包 Seed 2.0 来了:字节模型跨越鸿沟

春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。

MacTalk
算法论文7

R1/Qwen训练新范式:无需继续训练,直接“算”出权重,提效500%

DeepSeek - R1爆火让RLVR成大模型后训练焦点,但训练代价高昂。学者发现RLVR中LLM权重和输出概率呈线性变化,提出“权重外推”等方法,实现最高6.1倍训练加速,RL - Extra在多榜单展现高效率。

PaperAgent
开源动态8

字节Seed团队发布Seed1.5-VL,用仅20B活跃参数在60个主流测试中狂揽38项第一!

字节Seed团队发布Seed1.5-VL,仅200亿活跃参数就在60个主流测试中获38项第一。介绍其架构、预训练、后训练等情况,评估表现出色,虽处理复杂场景有局限,但仍在多模态任务取得显著进展。

深度学习自然语言处理
产品应用7

快手可灵也吃上了香蕉,一通离谱prompt测试,好好玩要爆了

ChatGPT发布三周年,快手可灵AI视频「O1模型」登场,号称“全球首个统一多模态视频模型”。实测显示它能一站式搞定视频修改、镜头延展等操作,还推出了图片O1模型,在图片生成方面表现出色。

量子位
开源动态7

Rex-Omni:用 3B 模型颠覆目标检测

长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态大模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。

带你学AI
新闻资讯7

20%的美国打工人把活儿甩给AI!被替代的是任务,不是岗位

8月6日,Epoch AI联合Ipsos发布职场调查报告,20%美国就业者将工作甩给AI,表明活儿在人和AI间重新分配。AI参与广但不深入,用时情况不一,输出多需修改,先冲击外包工作,且使用不均衡。

新智元
新闻资讯8

碾压小扎!22岁成亿万富翁,2025年AI造富速度刷新人类认知

2025年AI成超级造富机,将50多位创始人送入亿万富翁俱乐部。从大模型到应用层,AI渗透生活。巨额融资不断,巨头砸钱建基建,人才争夺激烈,多模态初创公司也受青睐,职场AI使用比例上升。

新智元
算法论文7

The Batch: 884 | Transformer获得新能量

弗吉尼亚大学等机构的研究人员提出 Energy-Based Transformer(EBT),它能检查自身输出。训练时通过能量值优化预测概率向量,测试显示其泛化优但生成特定文本差,扩展性好,为高性能带来新可能。

DeeplearningAI