多语言支持」共找到 5479 篇相关文章

新闻资讯8

Mistral 发布 OCR 3,提升了手写及结构化文档识别的准确率

Mistral 发布 OCR 3,在种文档类型上精度更高,超越前一代产品。能提取文本、识别图像并保留文档结构,输出 Markdown 格式。早期用户认可其性能和多语言支持,生产部署扩展快,价格有优势。

InfoQ
开源动态8

音频全能王炸!小米MiMo-Audio开源,力压Gemini/GPT-4o!

小米团队开源通用音频大模型MiMo-Audio,集种功能于一身,支持7国语言零样本克隆和中英混合合成。首包延迟低,效果自然稳定。在个基准测试中表现优于Gemini-2.5-Flash和GPT-4o-Audio。

开源星探
产品应用8

1w颗星!本地化视频翻译配音工具!

KrillinAI是功能音视频本地化与增强方案,面向人类用户和AI Agent。它功能全,覆盖视频处理完整链路;特点支持CLI调用等;还兼容种语音识别、大语言模型和TTS服务,可Docker部署。

GitHubStore
产品应用7

AI文本转语音进入“Next Level”!独角兽ElevenLabs发布Eleven v3:狠狠拿捏情感控制

独角兽ElevenLabs发布最新版TTS模型Eleven v3,支持70语言,能进行人对话,生动展现情绪语气。官方称其为“迄今为止最具表现力的文本转语音模型”,网友实测好评居,但中文效果不如英文。

量子位
开源动态8

张雪机车燃爆封神!国产2B语音模型重磅开源,全网听完都起鸡皮疙瘩

面壁智能联合方开发的2B小模型VoxCPM 2于4月开源,支持30种语言与9大方言,能实现声音克隆、情绪控制、音色设计等功能。实测显示其能力出色,还提供全家桶级工具箱,采用独特技术路线。

新智元
新闻资讯8

Altman 亲自坐镇发布 ChatGPT Image 2,小编实测:风格、画质、叙事感全都夯爆了

OpenAI CEO Sam Altman 亲自发布 ChatGPT Images 2.0,这是该公司迄今功能最强的图像生成模型。它有思考能力,可直出 8 张连贯图片,支持语言种画幅与分辨率,能精准执行复杂指令,直接商用也没问题。

InfoQ
算法论文8

Meta「分割一切」3.0曝光!技能语义分割加入概念提示,好好玩,要爆了

Meta第三代“分割一切”模型SAM 3悄然投稿ICLR 2026。它支持基于概念提示的实例分割,能听懂人话,处理图片快,还设计新架构、构建数据引擎、提出SA - Co基准,实验表现佳但也有局限。

量子位
推荐文章8

智能体在「燃烧」Token!Anthropic公开发现的一切

Anthropic发布智能体研究系统构建解释,解决智能体研究困惑。智能体系统优势明显,在特定任务中表现出色,但token消耗大。其架构独特,还介绍了提示词工程、评估方法、面临的工程挑战等内容。

机器之心
推荐文章8

游戏研发中的 AI 转型:网易 Agent 系统与知识工程实践

本文整理自网易游戏高级技术经理林香鑫分享,其团队通过代码知识谱图构建、 agent RAG 召回等技术打造超级助手,在业务场景落地效果好。还介绍知识工程、 Agent 赋能代码编写、AI 审查等实践及未来展望。

AI前线
产品应用7

从聊天窗口到 Agent 控制台:一次 AI 编程协作范式的转移

作者分享了从单 Agent 协作到 Agent 协作的编程范式转变。当前主流 AI 开发为单 Agent 协作,效率低,作者设计了 Mexus 工具,解决 Agent 协作、观测、Review 等问题,重塑人与 AI 协作关系。

阿里云开发者