文本token」共找到 1062 篇相关文章

开源动态8

仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!

剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。

PaperAgent
开源动态8

85倍速度碾压:苹果开源FastVLM,能在iphone直接运行的视觉语言模型

苹果开源能在 iPhone 上运行的视觉语言模型 FastVLM,代码仓库含 iOS/macOS 演示应用。它速度快,首个 token 输出速度较同类模型提升 85 倍,还兼容主流 LLM,适合边缘设备等场景。

机器之心
新闻资讯7

开发边界消失是必然,但 AI 没有替代开发者!对话 Google 全球开发者生态总监 David McLaughlin

文章是对 Google 全球开发者生态总监 David McLaughlin 的访谈。谈到 AI 会让开发边界消失,开发者应转变思维,AI 增强而非替代开发者,还探讨了谷歌工具策略、开发者出海问题、Token 管理等。

AI科技大本营
开源动态8

10.2k星!Firecrawl开源PDF解析神器,大幅降低OCR成本

处理PDF时,若全用OCR成本和延迟会增加,直接提取文本又易遇乱序、乱码等问题。Firecrawl开源的pdf - inspector工具能智能区分扫描版和文本版PDF,按需使用OCR,精准处理。

开源AI项目落地
产品应用8

阿里 Qwen3-TTS 两大更新直接封神!支持跨物种音色克隆,3 秒复刻!

阿里通义上线 Qwen3-TTS 两大核心能力,VoiceDesign 支持全文本控制音色特征,VoiceClone 能 3 秒音频跨语言、跨物种克隆音色。更新指标亮眼,如 0.1 秒级生成速度等,还可上手体验。

开源星探
新闻资讯7

OpenAI主攻速度的第一个模型来了:GPT‑5.3‑Codex‑Spark

OpenAI发布GPT-5.3-Codex-Spark,是GPT-5.3-Codex轻量级版本,也是首个为实时编程设计的模型。亮点是速度快,推理超每秒1000 token,已向ChatGPT Pro用户开放,后续规划融合两种工作模式。

AI寒武纪
开源动态8

谷歌开源非结构化数据抽取工具

谷歌开源 Python 库 LangExtract,用 LLM 从非结构化文本文档提取结构化信息。它定位精确、输出可靠,针对长文档优化,有交互式可视化,支持多模型,适应多领域,还给出快速开始示例。

GitHubStore
推荐文章8

Anthropic发布循环设计指南:权威拆解当下最火的AI新范式loop

Claude Code团队明确loop定义,将其分四大类,给出选择循环及控制Token消耗的实用指南,还介绍保持代码质量方法,最后总结各循环适用场景、建议功能,指导用户开始使用。

AI寒武纪
开源动态8

多模态Qwen3-VL-Embedding开源&技术剖析

互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。

PaperAgent
产品应用8

Claude Code 的"懒加载"更新:AI 终于学会了"随叫随到"

Claude Code推出Tool Search功能,解决AI工具生态困境。它采用“懒加载”,按需调用工具,节省大量token。这反映AI工具生态从“能用就行”走向“精打细算”,对用户和开发者均有益。

宝玉AI