多语言支持」共找到 5479 篇相关文章

开源动态8

Apple | 开源视觉语言模型:FastVLM,可手机运行,首token速度提升 85 倍

苹果开源能在 iPhone 上运行的视觉语言模型 FastVLM,代码仓库含 iOS/macOS 演示应用。它解决体积和速度问题,首 token 输出速度提升 85 倍,引入 FastViTHD 编码器,适配 iOS/Mac 生态,有不同参数量级版本。

AINLPer
开源动态7

3.3k星星爆火!Claude Design开源升级版,中文本地化,支持DeepSeek V4

Anthropic发布的Claude Design能生成UI、人机协作,但国内无法使用且不能用自己的API。Open-codesign是其开源本地化平替方案,支持模型,功能丰富,保密性好。

开源AI项目落地
开源动态8

6小时复刻AI IMO金牌成果,蚂蚁智能体新进展已开源

2025年IMO赛场,顶尖大模型起初表现不佳后有突破。蚂蚁AWorld项目团队6小时复现并开源DeepMind解题结果,给出可一键运行系统。AWorld证明智能体协同优势,还介绍复现思路、核心优势及体验方式。

量子位
开源动态8

这款OCR神器绝了,PDF、表格、手写体通吃,20+文档支持,9.4K Star!

开源君在Github发现开源OCR工具Zerox,由Omni - AI团队开发,利用AI视觉模型“阅读”文档,将种格式文档转Markdown。它功能强大,处理复杂文档优势明显,在Github获9.4K Star。

开源先锋
推荐文章7

深入解析邻国的 FinOps 之旅:将云支出转化为工程洞察

邻国在《每位工程师都该了解的 FinOps》中分享实践经验,将财务意识融入工程流程,用成本可视化机制让开发者了解成本影响,采用相关指标平衡创新与效率,借助工具优化成本,行业正从‘削减成本’转向‘数据驱动责任制’。

InfoQ
算法论文8

Stream-Omni:同时支持各种模态组合交互的文本-视觉-语音模态大模型

中国科学院计算技术研究所团队提出文本-视觉-语音模态大模型Stream-Omni,能支持种模态组合交互。它对各模态关系针对性建模,实现高效灵活的模态对齐,仅用少量语音数据就有种交互能力。

机器之心
开源动态8

Github 8.7K star 厉害!!! 一款轻量好用的web自动化项目!

Nanobrowser是开源Chrome扩展工具,专注AI驱动的网页自动化。免费且本地运行,保护隐私,支持主流大模型。有智能体协同等特点,还介绍了安装配置方法,是高效安全的网页自动化之选。

开源先锋
产品应用7

智能PPT生成系统

MultiAgentPPT是基于A2A + MCP + ADK的智能体系统,能流式并发生成高质量PPT。它通过智能体协作,从大纲生成到内容汇总,提高效率与准确性,还介绍了使用界面、项目结构、快速开始步骤等。

GitHubStore
开源动态8

开源两天斩获 1.8K Star!把网站变成命令行工具,支持国内外主流平台!

OpenCLI是开源的AI原生命令行工具,能把网站或Electron应用变命令行接口,复用Chrome登录状态,安全性高。支持19个主流平台,有自修复配置等亮点,还介绍了安装、使用、诊断及下载方法。

开源星探
算法论文8

扩散语言模型九倍推理加速!上海交大:KV Cache并非自回归模型的专属技巧

上海交通大学EPIC Lab团队提出免训练推理缓存机制dLLM - Cache,复用特征降低计算量。它即插即用,通用于主流dLLM架构,在个基准测试中实现数倍推理加速,且不降低生成质量。

量子位