多模态视觉理解模型」共找到 1928 篇相关文章

开源动态8

杨植麟亲自发布,月之暗面最强模型Kimi K2.5开源

杨植麟发布月之暗面最强模型Kimi K2.5,经约15万亿视觉与文本混合数据预训练,有顶尖编程与视觉能力及智能体蜂群范式。在多基准测试表现优,成本低于对手,还能提升办公生产力。

AIGC开放社区
算法论文8

VLA统一架构新突破:自回归世界模型引领具身智能

北京智源研究院联合中科院自动化所提出 UniVLA 全新 VLA 模型架构,基于全离散、自回归机制建模多模态信号,后训练引入世界模型。它刷新多项基准纪录,在真机操控和自动驾驶有潜力,为多模态感知决策融合带来新思路。

机器之心
算法论文8

突破单token预测局限!南洋理工首次将多token预测引入微调,编程任务准确率提升11.67%

当前主流大语言模型依赖下一token预测训练,难理解跨多token完整概念。南洋理工大学提出概念感知微调(CAFT)技术,首次将多token预测引入微调,能让模型理解完整概念,多领域实验显示其可显著提升模型性能。

量子位
推荐文章7

大模型狙击黑产:挚文集团社交生态攻防实战全揭秘

挚文集团生态技术负责人李波在AICon大会分享大模型在社交生态落地实践。介绍集团生态问题,提出构建治理框架,还阐述多模态大模型研发方案、细粒度用户画像建设及审核侧应用,最后总结现状并展望未来。

InfoQ
算法论文8

ICML2025 | 揭示MLLM的图文联动推理能力

当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。

深度学习自然语言处理
产品应用8

前端同事看走眼了,这个“游戏网页”其实全是AI写的!

Kimi K2.5上新,集视觉理解、代码生成等能力于一体,提供四种使用模式,其中Agent集群模式提效显著。实测显示其网页生成、动效理解能力出色,下一代K3模型或用新架构KDA降低计算成本。

InfoQ
开源动态8

Qwen3.6-27B 开源:小小身材,超级码力

阿里云宣布开源 Qwen3.6-27B 多模态模型,支持多模态思考与非思考模式,在智能体编程方面超前代旗舰 Qwen3.5-397B-A17B。它已在 Qwen Studio 上线,开源权重可从 Hugging Face 和 ModelScope 下载,阿里云百炼 API 即将支持。

千问大模型
新闻资讯7

AI证伪百年数学猜想被打假!Lean证明惊现漏洞,哥大教授破防了

OpenAI新推理模型取得十项数学进展,如证明非Sofic群存在性等。哥伦比亚大学副教授Henry Yuen对其量子并行重复定理证明既兴奋又失望,因证明有AI味且难理解。此外,Lean证伪科拉兹猜想被指利用内核漏洞,专家提醒Lean验证有局限。

新智元
新闻资讯7

多模态爆发之后,谈 AI、IP 与漫剧

文章围绕AI漫剧展开,讲述其兴起动因,如技术突破、成本降低等;探讨IP创作该选成熟IP还是新IP;展望未来,认为它可能成主流,但要解决内容和技术难题;还提及工具平台与内容收益问题。

特工宇宙
推荐文章7

关于Pingpong和Cooperative的一些感性理解

作者团队在SGLang支持Hopper架构相关GEMM,经分析发现多数场景Pingpong调度策略性能优于Cooperative,K维度小的场景DeepGEMM性能优于CUTLASS。本文重点介绍Pingpong性能优势及Cooperative无法Overlap Epilogue的原因。

GiantPandaLLM