视觉Token压缩」共找到 1385 篇相关文章

开源动态8

斩获22K star!再见重复劳动,微软AI开源智能办公机器人来了!抓紧用起来

微软推出视觉自动化神器`OmniParser`,上线GitHub获22K star。它重新定义人机协作,有三大能力、五大自动化杀手锏,适用于六大实战场景,还给出速成指南,与同类方案相比优势明显,正重塑办公范式。

小华同学ai
8

造ChatGPT的人,已经不用ChatGPT干活了

不到一年,OpenAI就把主力AI从ChatGPT换成AI智能体Codex。到2026年6月,Codex吃下全公司每周99.8%的输出token。各部门都将其作为头号工具,它还成通用工作流智能体。

新智元
开源动态8

本周 5 个超酷 GitHub 开源项目,实用到飞起!

本文介绍本周5个超酷GitHub开源项目。有显示苹果设备电池状态的AirBattery,开源卫星可视化平台keeptrack.space,本地图片压缩工具Pic - Smaller,跨平台端口助手Port - Killer,轻量级AI证件照工具HivisionIDPhotos。

开源先锋
新闻资讯7

Cloudflare 构建了面向 LLM 的高性能基础设施

Cloudflare发布全新基础设施,可在全球边缘网络运行大型AI大语言模型。它将模型输入处理与输出生成拆分,自研Infire推理引擎,还推出Unweight模型压缩系统,分享提示词缓存优化方案。

InfoQ
新闻资讯7

DeepSeek深夜更新后自曝:我是V4(?!)

DeepSeek网页端深夜大更新,推出「快速模式」和「专家模式」,还有「视觉模型」开启灰度测试。虽官方未说明,但网友推测专家模式可能是V4或V4 Lite,完整版V4或许不远。

量子位
算法论文8

警惕!大模型成本倒挂:你正在为模型的多余「思考」买单

一项来自多所高校和微软研究院的研究揭示AI模型价格倒挂现象,低定价模型可能产生更高实际开销。研究聚焦8个前沿推理模型和9个主流数据集,指出推理token是成本倒挂主因,且实际开销难以预测。

机器之心
产品应用7

大神卡帕西又一构想落地!Claude Code + Obsidian 爆火:创建你的「第二大脑」

2026年4月,Andrej Karpathy提出LLM Wiki,将LLM使用范式推向「知识生产系统」。6月27日,RGK用Claude Code + Obsidian构建“第二大脑系统”,解决记忆、上下文、执行问题,还引入反馈机制、优化Token成本。

AI科技评论
算法论文8

中山大学梁小丹团队论文:让视频生成从「看起来真实」到「物理上正确」丨CVPR 2026

中山大学梁小丹团队提出《ProPhy: Progressive Physical Alignment for Dynamic World Simulation》,通过分层建模和逐步对齐,引入视觉语言模型作监督,解决视频生成模型物理建模问题,提升物理正确性和视频质量。

AI科技评论
产品应用8

干翻全场!OpenAI深夜发布通用Agent。

OpenAI 发布 ChatGPT Agent,将 Operator 和 Deep Research 能力融合,能在虚拟电脑完成复杂任务。它功能强大亮点多,但也存在价格昂贵、安全隐患等问题,或压缩创业公司空间。

探索AGI
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位