「VLM多模态理解能力」共找到 1578 篇相关文章
你的数字伴侣贝拉 (Bella),正在唤醒!
贝拉是数字伴侣种子,愿景是成用户持久个性化伙伴。早期通过轮播视频呈现,采用AI原生开发路径,分感知核心、生成式自我、主动式陪伴三阶段构建,目标是成为由AI驱动的生命体。
Claude Code有救了,这个开源的GUI解决了很多使用体验问题。
Claude Code强大但命令行操作不便,缺少历史记录、回滚等功能。开源的Claudia GUI工具解决诸多问题,将命令行转化为图形界面,支持会话管理、检查点回滚等,性能优异且跨平台。
o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石
文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。
Claude团队打开大模型「脑回路」,开源LLM思维可视化工具来了
Claude团队推出“电路追踪”工具,可生成归因图呈现LLM处理信息路径,支持在主流开源权重模型上快速生成。研究人员能借此解码LLM“决策逻辑”,官方还给出多语言电路等示例。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。
图文跨模态“近视”问题破局:360开源新模型 FG-CLIP,实现细粒度图文对齐突破|ICML2025
360人工智能研究院发布 FG - CLIP 模型,攻克图文细粒度对齐难题,成果被 ICML 2025 接收并开源。它采用双阶段训练等策略,在多任务评测中超越对比模型,推动跨模态研究产业化落地。
DeepSeek-R1发布后的100天复现之旅方法总结
DeepSeek团队发布「推理大模型」DeepSeek-R1 ,其技术细节未完全开源,全球研究团队开启“复现竞赛”。论文总结100天复现经验,介绍推理大模型与普通大模型区别、复现方法、关键发现及未来方向。
从视觉压缩,到视觉记忆:MonkeyOCRv2以重建保留文档页面证据
文档视觉编码器对LLM理解和推理很重要。MonkeyOCRv2提出‘重建即文档视觉记忆’,通过多组实验验证其有效性,还发布MonkeyDoc v2数据集,推动公平比较的研究文化。
ICML 2026现场最全索引:从快手到大厂,中国企业集体出征
ICML 2026 于7月6 - 11日在韩国首尔召开,投稿量翻倍,录用率26.6%。中国企业全面出击,快手、阿里千问等入选多篇论文,现场活动丰富。中国机构研究呈现从发论文到做现场、单点到系统布局、聚焦效率等趋势。
当设计师和PM都开始写代码,产品构建方式又要变天了?
Notion 产品负责人 Max Schoening 与主持人探讨 AI 对软件构建和使用方式的影响。他认为成功产品有强大核心,鼓励设计师和 PM 用代码思考,还谈到岗位融合、可塑性软件、SaaS 趋势等话题。