「文本交互」共找到 1039 篇相关文章
一键秒懂GitHub仓库,开发者必备!
面对陌生的GitHub项目,直接把代码扔给AI效果不佳。而`Gitingest`这款开源工具,能将Git仓库转化为适合LLM处理的文本摘要,适配各类AI助手输入需求,使用方式灵活,在GitHub上很受欢迎。
仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!
剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。
通义实验室新研究:大模型自己「扮演」搜索引擎,提升推理能力无需搜索API
阿里通义实验室开源ZeroSearch,提供无需与真实搜索引擎交互的强化学习框架。它用模拟搜索环境和渐进式抗噪训练,让LLM自给自足,节省API成本,在多问答数据集表现优,为智能化检索提供新思路。
今年 AGI 大会上,这 10 个创业团队最受关注
在 AGI Playground 2026 的 Founder Show 活动上,10 个创业团队展示项目,横跨 Agent 基础设施、Physical AI 等方向。如 Tap8 实时生成交互视频,EigenFlux 为 AI Agent 建网络,Aceii One 是 AI 网球机器人等。
10.2k星!Firecrawl开源PDF解析神器,大幅降低OCR成本
处理PDF时,若全用OCR成本和延迟会增加,直接提取文本又易遇乱序、乱码等问题。Firecrawl开源的pdf - inspector工具能智能区分扫描版和文本版PDF,按需使用OCR,精准处理。
阿里 Qwen3-TTS 两大更新直接封神!支持跨物种音色克隆,3 秒复刻!
阿里通义上线 Qwen3-TTS 两大核心能力,VoiceDesign 支持全文本控制音色特征,VoiceClone 能 3 秒音频跨语言、跨物种克隆音色。更新指标亮眼,如 0.1 秒级生成速度等,还可上手体验。
前端没死,AI APP正在返祖
蚂蚁集团翁欣旦在SEE Conf大会提出,前端未被AI杀死,复杂度只是换形式存在。AI APP有交互和架构的返祖现象,终端因网络和算力限制不可替代,程序员应利用工程经验把握AI应用机会。
谷歌开源非结构化数据抽取工具
谷歌开源 Python 库 LangExtract,用 LLM 从非结构化文本文档提取结构化信息。它定位精确、输出可靠,针对长文档优化,有交互式可视化,支持多模型,适应多领域,还给出快速开始示例。
多模态Qwen3-VL-Embedding开源&技术剖析
互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。
微软深夜送出程序员节最“离谱”的礼物:让Mico接管你的Copilot
2025年10月23日,微软发布“Copilot秋季发布版”,将Copilot升级为“情境AI基础设施”,更新12项关键功能,最瞩目是新增角色Mico。它能反映情绪,是微软人机交互探索的延续,引发网友讨论。