「多模态理解」共找到 1546 篇相关文章
Qwen3.8-Flash:全新架构,更强更稳更划算
本文介绍了 Qwen3.8-Flash 多模态 MoE 模型,它原生支持 262,144 token 上下文。该模型在 Attention、Residual、Embedding 与 Optimization 四个方面系统升级,降低训练与推理成本,即将上线千问 AI 平台。还发布了 Qwen3.8-Flash-Next 开源权重。
字节Seed团队发布Seed1.5-VL,用仅20B活跃参数在60个主流测试中狂揽38项第一!
字节Seed团队发布Seed1.5-VL,仅200亿活跃参数就在60个主流测试中获38项第一。介绍其架构、预训练、后训练等情况,评估表现出色,虽处理复杂场景有局限,但仍在多模态任务取得显著进展。
快手可灵也吃上了香蕉,一通离谱prompt测试,好好玩要爆了
ChatGPT发布三周年,快手可灵AI视频「O1模型」登场,号称“全球首个统一多模态视频模型”。实测显示它能一站式搞定视频修改、镜头延展等操作,还推出了图片O1模型,在图片生成方面表现出色。
碾压小扎!22岁成亿万富翁,2025年AI造富速度刷新人类认知
2025年AI成超级造富机,将50多位创始人送入亿万富翁俱乐部。从大模型到应用层,AI渗透生活。巨额融资不断,巨头砸钱建基建,人才争夺激烈,多模态初创公司也受青睐,职场AI使用比例上升。
南洋理工 | 推出开源版MetaQuery:OpenUni,1.1B参数媲美BLIP3-o-8B
南洋理工大学 S-Lab 和商汤科技团队推出开源版 MetaQuery——OpenUni,仅 1.1B 参数就达 8B 模型性能。它架构极简、参数高效且完全开源,还采用两阶段训练策略,虽有局限但为多模态模型研究助力。
50个Agent分工干活,Kimi K2.5的Agent“军团”把我看呆了。。。
Kimi K2.5今日下午发布并开源,具备多模态能力。它能根据视频、链接等复刻网站,有Visual Edit功能且自动部署上线。还有Agent Swarm场景,多Agent协作解决复杂问题,应用体验佳。
看完最新国产AI写的公众号文章,我慌了!
AI 快砸作者饭碗,智谱 GLM - 4.6V 能根据 NeurIPS 2025 最佳论文生成图文并茂的公众号文章。它还能助力学生看论文、分析财报等,可复刻网站、处理视频,在多模态评测中达同级别 SOTA。
苹果传统强项再发力,视觉领域三种模态终于统一
苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。
小小具身智能成果,高中生在腾讯拿下!
腾讯2025星火挑战周上,八十余位高中生聚焦前沿课题取得诸多成果,如具身智能成果获张正友点赞。课题涉及具身智能与机器人、长文本理解等方向,不少项目有实用价值,68名同学获清北offer。
Hinton与姚期智对谈:认为人类的意识特殊,那是危险的无稽之谈
图灵奖得主Geoffery Hinton与姚期智对谈AI相关话题。Hinton认为人脑可给AI借鉴,还探讨人类未来与AI道德,强调训练善良AI重要;他觉得大模型有理解能力,将人类意识特殊化是危险无稽之谈。