「视觉token剪枝」共找到 1257 篇相关文章
OpenAI深夜双王炸!GPT-5.1 Pro紧急发布,降维打击Gemini 3
OpenAI同一天发布GPT-5.1 Pro和GPT-5.1-Codex-Max。前者向Pro订阅用户推出,主打「情商智商」双强;后者在Codex平台上线,专为「长时间、高强度」开发任务设计,采用「压缩」机制,表现出色。
Nano Banana 2突然现身!能画公式解数学题,监控画面都能伪造
Nano Banana 2代以预览版现身第三方网站,后被移除。其能力远超1代,能处理复杂提示,可生成复杂UI、解数学题甚至伪造监控画面。谷歌正将Nano Banana整合进核心产品生态。
终于有AI视频模型,解决了体操难题。
前天深夜MiniMax发布Hailuo 02视频模型,虽未正式上线但放了预告片。该模型能生成杂技动作,解决了体操难题,在复杂动作肢体表现上吊打其他模型,还支持原生1080P,价格便宜。
图文跨模态“近视”问题破局:360开源新模型 FG-CLIP,实现细粒度图文对齐突破|ICML2025
360人工智能研究院发布 FG - CLIP 模型,攻克图文细粒度对齐难题,成果被 ICML 2025 接收并开源。它采用双阶段训练等策略,在多任务评测中超越对比模型,推动跨模态研究产业化落地。
一行 Python,生成绝美城市地图海报!
开源君发现宝藏项目`prettymaps`,这是巴西开发者Marcelo Prates的开源作品,能从OpenStreetMap拉取数据画定制地图。它功能丰富,安装简单,可让普通人轻松进行地图视觉创作。
AI Infra入门干货总结:大模型是如何高效推理的
作者深入研读vLLM源码,以Llama 3为例,聚焦Decoder-Only架构LLM,介绍推理各环节及张量维度变化,讲解连续批处理和Paged Attention概念,还阐述推理流程、采样策略等,最后总结相关拓展内容。
Claude Opus 4.7发布:更强能力,自我纠错,越来越不需要人类干预了
Anthropic发布Claude Opus 4.7版本,搭配Routines功能可自动化工作,人类干预减少。该版本能力大幅增强,还引入护栏机制保障安全,推出新运算级别和任务预算功能。
解决VLA模型落地难,普通硬件也能跑!全透明全开源的高效VLA模型把推理成本砍掉76%
2026年4月,中山大学与MBZUAI联合推出A₁模型,它是完全开源透明、自适应高效的截断式视觉 - 语言 - 动作模型,能削减推理成本、实现低成本落地,在仿真与真机上表现优异。
开源音视频同步SOTA基座:极简的单流架构,2秒出片
AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。
第二代AI预训练范式:预测下个物理状态
英伟达科学家Jim Fan发布文章《第二代预训练范式》指出,当前以LLM为代表的AI模型基于「对下一词的预测」,在物理世界应用中「水土不服」,第二代范式应是「预测下一个物理状态」,引发机器学习社区讨论。