视觉文本渲染」共找到 1119 篇相关文章

算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
产品应用8

阿里 Qwen3-TTS 全新上线!支持9种方言+49种音色,连天津味儿都拿捏了!

阿里通义团队上新 Qwen3-TTS 文本转语音模型,主打拟人语音表达、丰富音色体系与多语言多方言能力。有 49 种高保真音色,支持 10 种语言、9 种方言,还能智能调节语速和韵律。

开源星探
产品应用8

新晋顶流Agent颠覆设计师!Lovart一手实测来了:是该刷屏爆火

新晋顶流Agent Lovart火爆全网,可一句话搞定专业视觉设计,支持二次编辑。量子位实测其设计能力强,背后是多模型融合调度。它定位人机协作,适合中小企业,官网可申请内测。

量子位
开源动态8

4 天 6.8K Star,这个 AI 漫剧项目火了:waoowaoo!

短剧/漫剧市场火爆,但普通人制作门槛高。waoowaoo是solo开发者作品,4天6.8K Star。它能从小说文本一键生成视频,涵盖AI剧本分析、角色场景生成等功能,部署简单,技术栈主流。

开源星探
算法论文8

DeepSeek又又又又发新论文了!这一次,他们重构了AI看图的方式

DeepSeek发布论文DeepSeek - OCR 2,指出传统AI看图方式有误,提出视觉因果流概念。其两阶段级联推理解法效果显著,还可能整合进即将发布的DeepSeek V4,有望实现原生多模态。

花叔
算法论文8

不靠英伟达,中科院在国产 GPU 上跑通 76B 类脑大模型

过去大模型依赖Transformer和NVIDIA GPU体系,硬件自主化难。中科院团队提出类脑大模型SpikingBrain,在超长文本处理上百倍加速,在国产MetaX GPU平台稳定训练76B模型,开辟新道路。

AI科技评论
开源动态8

这款OCR神器绝了,PDF、表格、手写体通吃,20+文档支持,9.4K Star!

开源君在Github发现开源OCR工具Zerox,由Omni - AI团队开发,利用AI视觉模型“阅读”文档,将多种格式文档转Markdown。它功能强大,处理复杂文档优势明显,在Github获9.4K Star。

开源先锋
开源动态7

MIT团队完成AI控制人类行为实验项目

MIT团队的Human Operator项目是实时人体增强工具,也是MIT Hard Mode 2026获奖项目。它通过视觉 - 语言模型结合电刺激肌肉实现人体运动控制,介绍了技术栈、环境要求、软硬件准备、安装步骤等。

GitHubStore
开源动态8

仅 3MB 大小,终端极速预览 word!

开发者等常需在服务器或命令行环境查看Word文档,传统方式低效。开源神器doxx基于Rust开发,无需Microsoft Word等软件,有保留格式渲染、全文搜索等功能,还提供多种安装渠道。

开源先锋
算法论文8

LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性双丰收

LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。

机器之心