「视觉tokenizer」共找到 1242 篇相关文章
AI 产业终于等来了自己的“支付宝时刻”
本周支付宝发布面向 AI Agentic Commerce 的全栈支付解决方案。该方案含信任基座、收付引擎、AI 钱包助手和 Token Pay,解决支付安全、收付款及管控等问题,推动 AI 产业从工具走向商业循环。
知名产品工程师开源「一整套编程skill」,每个人都能有顶级的工程习惯
现在用AI写代码存在效率低、浪费token等问题,知名开发者tw93发起开源AI编程skill库Waza,将顶尖工程师习惯转化为Claude Code可运行技能,推出8实用技能,还提供两个小脚本。
Karpathy 亲手终结了RAG的草莽时代
Andrej Karpathy分享“LLM Wiki”工作流,将多数Token用于构建“可演化知识库”。此方法不依赖复杂架构,在中等规模数据集上展现出强大能力,引发“LLM Wiki杀死RAG”的讨论,在技术社区和企业级市场反响热烈。
清华、西交联合开源发布了Cheers : 一条更简洁、更高效的统一多模态路线
清华、西交联合开源发布CHEERS,提出面向统一多模态理解与生成的架构路线,在保持系统简洁前提下,统一理解与生成任务,继承开源预训练模型知识,在多项基准测试中表现优异,还实现4× token压缩。
Claude能直接操控你的电脑微信了,这才是真正的上位小龙虾。
Claude新发更新,可通过Computer use纯视觉方案操控电脑,还更新了远程操控Dispatch。这俩功能组合让Claude能操控微信等本地软件,使用简单,且权限管控和防护较好,更新速度快,领先同类产品。
打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26
现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。
对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容
本文对话 Seede AI 创始人 Longyi,探讨 AI 设计产品发展。Seede AI 主打将原始素材转化为可交付设计稿,易上手、受众广。创始人认为不转向 AI - Native 没救,产品已跑通 PMF,目标是帮人类理解 Agent 产出内容。
Win版Claude Cowork杀疯了!140元雇个全职AI员工,全网首测真香
昆仑万维推出天工Skywork桌面版,专为Windows打造,能调用Claude和Gemini。实测显示,它可高效分类文件夹、提取图片、生成报告等。相比Claude Cowork,其在生态、视觉、模型等方面有优势,还降低了办公门槛。
阿里通义新年礼物:开源最强Qwen-Image-2512版本告别AI塑料感与文字乱码
通义万相新年前发布Qwen - Image - 2512版本。它是开源界最强文生图模型,在AI Arena盲测中表现出色。能消除AI塑料感,攻克文字渲染难题,在还原真实世界和重构视觉元素逻辑排版上有显著提升。
SIGGRAPH Asia 2025|30FPS普通相机恢复200FPS细节,4D重建方案来了
3D视觉领域难题是用普通摄像机将高速世界转为数字化4D时空。受限于成本和带宽,现有方法有局限。本文提出“异步采集 + 视频扩散模型修复”方案,用30 FPS相机恢复100 - 200 FPS动态细节。