「文本领域」共找到 2144 篇相关文章
一键秒懂GitHub仓库,开发者必备!
面对陌生的GitHub项目,直接把代码扔给AI效果不佳。而`Gitingest`这款开源工具,能将Git仓库转化为适合LLM处理的文本摘要,适配各类AI助手输入需求,使用方式灵活,在GitHub上很受欢迎。
MCU、储存、SiC、传感器、MLCC……国产汽车“硬核芯”全景突围
在国产汽车产业带动下,国产汽车芯片迈入新阶段。传统领域国内企业打入主流供应链,前沿赛道与国际巨头竞技。芯驰、芯擎等企业崭露头角,产业链协同推动供应链自主,芯师爷评选展现行业成果与潜力。
仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!
剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。
10.2k星!Firecrawl开源PDF解析神器,大幅降低OCR成本
处理PDF时,若全用OCR成本和延迟会增加,直接提取文本又易遇乱序、乱码等问题。Firecrawl开源的pdf - inspector工具能智能区分扫描版和文本版PDF,按需使用OCR,精准处理。
π0.7发布,VLA押出了机器人的GPT-3时刻
今天凌晨,Physical Intelligence发布VLA模型π0.7,首次在机器人领域证明组合泛化。它用多样化prompt处理多样数据,涌现多种能力,还证明数据过滤可能是伪问题,架构基于前作,推动VLA回归。
OpenClaw的风刮到了多模态生成,6B小模型超越Nano Banana 2!
现在多模态生成模型在复杂指令和下游任务表现不佳。上海人工智能实验室等团队提出GEMS,将OpenClaw成功应用于多模态生成领域,激发小模型潜力,让6B小模型部分任务超越Nano Banana 2。
中国开源首超美国:Hugging Face发布全球AI开源现状报告
Hugging Face发布报告显示,2025年开源AI生态繁荣,用户参与度高。中国首次超越美国,成月下载量最大的模型来源国。各国政府推动主权AI,硬件支持更多元,机器人和科学领域发展迅速。
阿里 Qwen3-TTS 两大更新直接封神!支持跨物种音色克隆,3 秒复刻!
阿里通义上线 Qwen3-TTS 两大核心能力,VoiceDesign 支持全文本控制音色特征,VoiceClone 能 3 秒音频跨语言、跨物种克隆音色。更新指标亮眼,如 0.1 秒级生成速度等,还可上手体验。
拯救大模型的逻辑短板:Nature文章预测符号主义AI与神经网络的联姻将引爆下一场技术革命
结合逻辑系统与神经网络成AI热门趋势,神经符号AI崛起,旨在弥补神经网络短板。虽面临技术挑战,但已在多领域展现潜力,不过也有质疑声,其发展仍面临诸多难题。
周志华,院士!
2025年中国科学院、工程院院士增选结果出炉,共144人当选,新增外籍院士51人。人工智能领域,南京大学周志华教授当选中科院院士。他成就颇丰,论文被引超11w次,《机器学习》成入门宝典。