「视觉分辨率路由」共找到 769 篇相关文章
Glyph:文本转图片解决长上下文困境,智谱把“DeepSeek-OCR”具像化了
传统 token 扩展方式遇算力成本天花板,DeepSeek 与智谱都想到让 AI“看”文字思路。智谱发布 Glyph 框架工程化实现此思路,将文本转图片处理,降低计算成本,有不错效果但也存在排版敏感等限制。
被DeepSeek带火的OCR,最新8个开源模型盘点~
DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。
AI视频界变天!Decart发布实时“Sora”,直播/游戏业或遭降维打击
Decart创业公司推出全球首个实时、无限长度的AI视频模型MirageLSD,基于独创LSD技术。其响应低于40毫秒,靠历史增强等技术攻克难题。它不止用于特效,平台将持续升级,创始人目标是打造‘千亿级独角兽’。
无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention
高质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。
谷歌发布本地具身智能模型!全程无联网执行精细操作,从人形机器人到工业机器人全覆盖
Google DeepMind团队发布可本地运行的视觉 - 语言 - 动作模型Gemini Robotics On - Device,它能离线运行,操作能力强,可在多种机器人本体部署,解决网络问题,性能、适应能力出色,还开放了SDK。
智能体请求暴增 9.4 倍,token 账单却没涨:Uber 公开 AI 软件工厂省钱方法
AI 工具已嵌入 Uber 软件开发各阶段,智能体请求量增长 9.4 倍,但 AI 总支出自 4 月相对稳定。文章介绍其软件工厂思考,包括智能体会话层级、成本公式、指标测算及优化手段,还提及未来举措。
世界模型再迎新突破,兔展智能UniWorld-View登顶WorldScore榜单
近年来,世界模型成视觉 AI 重要研究方向。兔展智能联合研发的 UniWorld - View 登顶 WorldScore 榜单,完成昇腾算力适配与开源。它聚焦让 AI 理解未拍摄世界,解决了诸多技术难题。
用3万小时触觉数据补齐具身智能「手感」,新智具身联合复旦大学统一触觉「方言」
新智具身联合复旦大学发布三份技术报告,将触觉跃升为具身智能核心基建。构建3万小时交互语料库统一触觉“方言”;提出新方案让机器人提前预判触觉;在世界模型中重构“触觉想象”,推动具身智能“视触融合”。
Fable 5被网友薅出省钱神招!最高减70%!
网友发现把Fable 5上下文转成图片,让模型通过OCR读取,token输入成本最多省70%。方法pxpipe在GitHub获3000+STAR,本质是本地代理,还引出谷歌老论文及DeepSeek - OCR相关技术。
看屏幕、用键鼠,我的 OpenClaw「睁眼」了
2026年5月11日,OpenClaw上线macOS桌面操控工具Peekaboo,提供像素级截图、UI元素识别和GUI自动化能力。它打破Agent局限,可接管桌面操作,部署简单,普通人也能用,还有安全保障,但也存在坐标偏移等问题。