视觉token剪枝」共找到 1253 篇相关文章

8

小米双模型正式开源!MiMo-V2.5-Pro无中断肝出“macOS”:54个应用全开、浏览器真能冲浪

小米MiMo-V2.5系列模型正式开源,权重全量开放。该系列含四大模型,综合实力对标国际顶尖水准。MiMo-V2.5 Pro能力出色,如4小时无中断完成“macOS”系统,且Token效率高省成本。小米还推出开发者扶持计划。

量子位
新闻资讯7

上周 GPT 和 Codex 各有一个发布,很多人没注意吗?可以解锁 Codex 百万上下文了

最近基模发布多,OpenAI 俩更新被低估忽略。一是 GPT - 5.6 Sol 的 Ultrafast 模式,输出最高达每秒 750 Token,先向少量 API 客户开放;二是 Codex 为其开放百万上下文能力,不过大窗口有代价。

MacTalk
产品应用8

突发,打工版Claude 5来了!人人都能用

Anthropic推出Claude Sonnet 5,代号Fennec。它性能直逼旗舰Opus 4.8,即日起成所有Free和Pro用户默认模型,能自主规划等。价格有促销,虽tokenizer或使花销增加,但仍比Opus划算,防护能力也强。

新智元
算法论文8

CVPR2026 | Streamo:让大模型变成实时流式交互助手

香港浸会大学联合腾讯优图实验室提出 Streamo,将‘何时回答’变为模型预测的 token,通过端到端训练框架把离线视频模型转化为实时流视频助手,还构建 Streamo - Instruct - 465K 数据集,实验效果良好。

机器之心
新闻资讯7

中国科技企业出海的6条最新趋势!

作者在美国拉斯维加斯CES展及硅谷调研后,总结了AI和中国科技企业出海的6条趋势,包括Token消耗激增使自研成大势,AI提升消费电子产品溢价,软硬件边界模糊等。

芯师爷
算法论文8

真·开外挂!MIT新研究:架构0改动,让大模型解锁千万级上下文

MIT CSAIL团队提出递归语言模型RLM,不改动模型架构,让GPT - 5、Qwen - 3等模型具备千万级token超长文本处理能力。它将上下文处理“外包”,实验显示其处理规模超前沿模型,复杂任务优势显著,多数场景性价比高。

量子位
开源动态8

图像编辑太慢太粗糙?全新开源自回归模型实现精准秒级修改 | 智象未来

AI图像编辑中扩散模型有两大难题,智象未来团队提出全新自回归图像编辑框架VAREdit,引入视觉自回归架构,提升编辑精准度与速度。模型和代码已开源,还提出SAR模块优化,在基准测试表现出色。

量子位
开源动态8

刚刚,智谱开源了他们的最强多模态模型,GLM-4.5v。

智谱接连开源GLM - 4.5和GLM - 4.5V,后者为多模态模型,总参数106B,在42个评测基准中41个达到SOTA。经测试,它视觉推理强、速度快,还有视频理解等功能,API定价良心,体现持续开放精神。

数字生命卡兹克
推荐文章7

AI们数不清六根手指,这事没那么简单。

作者测试发现Grok4、OpenAI o3等多模态模型都将六指图数成五指,仅Claude 4偶尔答对。研究揭示大模型看图片用记忆而非视觉,易受刻板印象影响,在工业等场景或引发严重后果。

数字生命卡兹克
开源动态8

论文秒变海报!开源框架PosterAgent一键生成顶会级学术Poster

本文介绍开源框架PosterAgent,它能一键将论文转为可编辑的学术海报。相比GPT - 4o,其生成指标优、token使用量少、成本低。研究团队构建评估标准Paper2Poster,实验显示PosterAgent在多方面表现出色。

量子位