「原生多模态」共找到 1333 篇相关文章
DeepSeek又又又又发新论文了!这一次,他们重构了AI看图的方式
DeepSeek发布论文DeepSeek - OCR 2,指出传统AI看图方式有误,提出视觉因果流概念。其两阶段级联推理解法效果显著,还可能整合进即将发布的DeepSeek V4,有望实现原生多模态。
马斯克都惊呼太强!阿里Qwen3.5又一波端侧小模型发布
上周阿里发布Qwen3.5中等规模超强模型,现又推出端侧小模型,获马斯克称赞。其智能密度翻倍且原生多模态,各型号有Base版。不同参数模型性能出色,阿里布局完整生态链,开启智能化未来。
DeepSeek出品,必是精品!DeepSeek-OCR 2发布:让LLM像人一样读懂复杂文档,效果超Gemini 3 Pro
DeepSeek推出DeepSeek-OCR 2,提出“视觉因果流”,以全新视觉编码器赋予模型因果推理能力。它在文档解析基准表现超Gemini 3 Pro,代码和模型权重已开源,为2D推理和原生多模态探索铺路。
登上NeurIPS,Genesis开创无需OCC引导的多模态生成新范式,在视频与激光雷达指标上达到SOTA水平
华中科技大学与小米汽车提出多模态图像 - 点云联合生成框架Genesis,采用两阶段架构和DataCrafter模块。在nuScenes数据集实验显示,其在视频与激光雷达指标达SOTA水平,还提升了下游感知任务效果。
24小时直播,只靠一张照片?虎牙实时多模态数字人VAM 1.0率先突围行业三堵墙
虎牙推出实时多模态数字人VAM 1.0,只需一张照片就能转化成能说会唱、可实时互动的数字人。它解决了AI数字人行业的时间、交互、部署三堵墙,稳定性、交互精度和响应速度表现出色,应用场景广泛。
华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元
华东师大智金院团队孵化的金融原生基模 Mint - Agent 发布,在 FinanceAgentBench v2 上表现超 GPT - 5.6 - Sol 与 Claude Opus 4.8,单题推理成本低,商业订单超亿元,进入规模化金融场景验证阶段。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA
中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。
3D生成到达3.0阶段,不止提升行业渗透率,也正催生3D原生新玩法 | 对话3D生成平台Tripo
AI 3D生成领域前景广阔但也有疑惑焦虑。量子位智库对话VAST创企,其创始人与CTO分享3D原生玩法、落地场景,还谈产品开发、需求发掘等认知,Tripo平台已覆盖众多用户。
豆包大模型2.0+Claude Skills,3步装好,终于有AI能帮我"看视频做笔记"了!火山引擎全系列可用!
传统视频总结工具只基于音频总结,内容浅显。而豆包大模型2.0是多模态原生模型,能同时处理画面和声音。只需3步安装配置,就能让它真正“看”视频,输出详细笔记。