图像token」共找到 1089 篇相关文章

算法论文8

ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链

随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。

机器之心
开源动态8

GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”

智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。

量子位
算法论文8

LLM算力告急?把文本变图片,推理成本直接减半!

大型语言模型处理长文本时计算成本高,本论文探索‘文本即图像’输入压缩策略,将长文本渲染为图像输入多模态模型,可减少近一半令牌,且任务性能不受显著影响,在多任务中验证了其有效性。

深度学习自然语言处理
新闻资讯7

AI 提效了,老板觉得自己又行了:可代码行数和 Token 排名,真该拿来裁人吗?

文章探讨AI提效下的行业现状。开发者节奏加快,企业收紧人力。不同行业提效有别,互联网显著,金融审慎。还谈及效率悖论、裁员依据、生产力衡量及成本管控,指出提效应用于承接项目而非裁员。

AI前线
算法论文8

空间智能新高度:港科大谭平团队SAIL-Recon突破万帧级图像大规模3D场景重建Transformer

香港科技大学谭平教授团队与地平线团队发布3D场景表征与大规模重建新方法SAIL - Recon,突破现有模型处理能力瓶颈,可实现万帧级场景表征抽取与定位重建,在多数据集上表现优于现有方法。

机器之心
算法论文8

想知道你的LLM API被过度收费了吗?隐藏的Tokens终于可以被审计了

马里兰大学CASE Lab团队研究商业不透明大模型服务(COLS),定义其风险,提出三层审计蓝图。还推出验证框架CoIn,能高效识别token数量膨胀,有可定制性且审计开销低,为构建信任提供技术支撑。

机器之心
产品应用7

智能体请求暴增 9.4 倍,token 账单却没涨:Uber 公开 AI 软件工厂省钱方法

AI 工具已嵌入 Uber 软件开发各阶段,智能体请求量增长 9.4 倍,但 AI 总支出自 4 月相对稳定。文章介绍其软件工厂思考,包括智能体会话层级、成本公式、指标测算及优化手段,还提及未来举措。

InfoQ
新闻资讯7

估值神话即将崩盘?Palantir CEO狂喷OpenAI和Anthtropic:拿走企业核心机密还要收过路费

Palantir CEO Alex Karp在电视采访中拆解OpenAI和Anthropic商业模式,指出企业花买token的钱未获匹配价值,商业机密被拿走。他质疑按token收费机制,认为不能稳定创造价值。还指出企业数据可能使模型取代自己,行业高估值或松动。

AI寒武纪
开源动态8

开源复现o3图像思考!快手让AI不再被动看图,模型自主生成代码调用工具

Kwai Keye团队提出Thyme新范式,构建技术方案,赋予开源模型“超越图像思考”能力。包括设计训练策略、构建开源配套资源,拓展多模态模型工具使用与决策水平,在基准测试中性能提升显著。

量子位
产品应用7

Claude Sonnet 4 上下文翻 5 倍!100 万 token 能处理更大型代码库,AI 代码分析起飞。

Claude Sonnet 4 加入‘百万 token 俱乐部’,上下文容量翻 5 倍达 100 万,能处理大型代码库。不过功能在 Beta 有使用门槛和限制,价格也有变化,还对比了市场上其他模型。

AI进修生