「多模态视觉语言模型」共找到 2249 篇相关文章
金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%
2025年6月以来多模态文档解析成前沿课题。MonkeyOCR v1.5是全新框架,在OmniDocBench v1.5等基准上全面突破,复杂表格等场景提升9.7%,采用两阶段解析管道和复杂表格处理方案。
5Y News|Kimi发布并开源 K2.5 模型,带来全新视觉理解、代码和Agent集群能力
2025年1月27日,月之暗面发布并开源Kimi K2.5模型,它是迄今最智能全能的模型,在多任务有出色表现。支持多模态输入,具备新能力,还推出Kimi Code工具,集群能力也开启Beta测试。
从 3 个月业余项目到全球第一语言!Python 之父坦言:当年“将就”的代码,如今全都真香了
Python 之父 Guido van Rossum 在 Python 编程语言峰会上提出‘Worse is better’理论现在是否还适用的问题。回顾早期开发,Python 受 UNIX 精神影响,以‘够用就好’理念快速推出,如今面临新功能开发慢、社区贡献不均等问题。
仅保留35% Token,性能反超原模型!快手可灵等用视觉信息引导音频压缩,推理时间直降42%
Omni - LLM计算浪费严重,快手可灵等团队提出OmniSIFT框架。它利用音视频非对称依赖关系,通过时空联合剪枝压缩视频、视觉引导筛选音频Token,大幅减少Token数量,提升性能和推理效率。
多模态AI黑马刷榜后再造神器:一个产品搞定图片视频播客生成,自带百种特效,大牛梅涛团队出品
AI大牛梅涛创立的智象未来公司推出vivago2.0(智小象AI),支持图片、视频、播客生成,有上百种特效模板,生图还能自动优化prompt。其依托HiDream - A1,结合HiDream - I1和HiDream - E1能力,团队技术实力强且融资顺利。
景不动人动,MLLM如何面对「移步换景」的真实世界?OST-Bench揭示多模态大模型在线时空理解短板
上海多所高校研究者提出 OST - Bench,从智能体探索场景动态在线视角挑战大模型能力。它更贴近真实世界,揭示主流多模态大模型在线时空理解短板,为未来模型发展指明方向。
社区供稿 | Hugging Face x 北京中关村学院等机构联合发布生成式基因组大模型Carbon:一场关于“生命语言”的范式革命
北京中关村学院等联合发布生成式基因组大模型Carbon并开源。Carbon家族有三个版本,旗舰模型Carbon - 3B在多任务匹敌70亿参数的Evo2 - 7B,运行速度快275倍。它在数据、分词、训练上有创新,还实现技术普惠,有多种应用场景。
数学奥赛高分摘金,位列大模型榜首,『书生』科学多模态大模型Intern-S1能力再升级 | 通专融合新进展
2025年CMO决赛首设AI测试,书生科学多模态大模型Intern-S1以102分位列大模型得分榜首,远超金牌线和国家集训队入选线。其推理能力提升得益于多项创新,未来将拓展至多领域科研。
深谋科技重磅发布真正为人类服务的新一代人形机器人核心技术「声波传感 · 意念控制 · 高精视觉 · 类脑智能」
深谋科技将在2025 WAIC展示陆上具身智能人形“美猴王”和空中具身智能巨兽“星汉一号”,并发布新一代人形机器人核心技术,包括传感、脑机交互等系统,构建具身智能全域系统闭环。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。