「VLM多模态理解能力」共找到 1578 篇相关文章
Legora、Mercor 都在用,Reducto 能成为独立的 LLM 数据入口吗?
当前企业AI落地瓶颈在数据质量,Reducto聚焦数据准确性,以文档解析API提供Agentic OCR能力。它获多轮融资,估值达6亿美元,但面临多模态模型竞争及定价等问题,其未来走向待察。
视觉模型既懂语义,又能还原细节,南洋理工&商汤提出棱镜假说
南洋理工与商汤团队提出 Prism Hypothesis(棱镜假说)与 Unified Autoencoding(UAE)。论文指出视觉基础模型中语义理解和像素保真很难兼得,用频率谱统一视角解决冲突,UAE 实验效果良好。
Karpathy新思考:别把AI当动物,它们是全新的智能物种
Andrej Karpathy发长推提出颠覆性观点,认为人们用错误框架理解AI,对比了动物智能与LLM智能的优化动力、根本差异等,强调优化目标决定智能形态,指出应按其机制对待AI。
小白也能秒懂:趣解GPU各种核心参数规格!
近期美国升级对英伟达H20芯片出口管制,业内震动。文章介绍GPU和显卡区别,讲解GPU关键参数如算力、核心数量等含义,还通过货车、火车类比助小白理解,助读者选合适GPU。
GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉
清华教授、智谱唐杰在𝕏征集GLM下个版本意见,浏览量达40w+。此前他有求必应,网友热情参与。这次评论区多要视觉能力,因GLM-5.2是纯文本模型,而对手多为多模态。
阿里Qwen-Image-2.0图像生成与编辑巅峰汇合,超真实、超强图文结合
阿里Qwen - Image - 2.0将生图与编辑能力合二为一。它支持长指令,能精准渲染大量文字,引入物理逻辑让文字呈现真实质感,在生图和编辑上对语义理解和画面重构能力强。
港大开源视频版RAG,像聊天一样看完百小时纪录片。
港大HKUDS团队开源超长视频理解框架VideoRAG,突破传统模型时长限制,支持对数百小时视频精准检索和问答。还有桌面应用Vimo,使用简单高效。介绍了其切片索引、混合检索、生成回答的实现逻辑。
Hugging Face开源nanoVLM,750行代码可训练视觉语言模型,简单到令人发指!
Hugging Face开源全新视觉语言模型框架nanoVLM,仅750行代码就能从零训练高效能VLM模型。它在单张H100 GPU训练6小时后,在MMStar数据集准确率达35.3%,且能在免费Google Colab跑。
千问办公初体验:“三合一”更好用吗?
作者体验阿里千问办公内测版,它是三合一AI产品Qwenwork。虽系统设计距Codex有差距,但整合优势对普通用户有意义,具备CLI化、生态打通、多模态、拓展生态等特点,不过还需打磨。
用Claude Code剪视频,自动去口癖、加字幕、调色,完全免费开源
browser - use团队开源Claude Code技能video - use,可自动去口癖、加字幕、调色等。它通过转录文本和按需视觉合成图让LLM理解视频,有完整流水线和设计原则,还给出使用方法。