「文字渲染」共找到 191 篇相关文章
别让Nano Banana骗了!混合方案让头像生成成功率从0到100%
作者用Nano banana更新头像时发现其生成中文能力差,提出将AI画图与HTML编程结合的方案。HTML搞定确定性、成本低部分,AI画图负责复杂、创意性高部分,还给出使用方法及多种头像加字设计方案。
让沉默三千年的甲骨开口:首个模仿人类专家工作流的辅助释读系统
近日,华中科技大学等联合团队推出首个模拟专家释读流程的人工智能系统AlphaOracle,辅助甲骨文破译。它整合多类资料,形成证据链,经专家评估,有较高评价且能节省分析时间。
SpecKit 在成熟 Java 项目中的 AI 编码实践
文章分享SpecKit在成熟Java项目的AI编码实践,引入其作为规范管理工具,按标准化流程操作。介绍选型、环境准备、执行步骤,分析优缺点,还提及Qwen - Image解决AI绘画文字问题。
DeepSeek-OCR降本增效,10×暴力压缩还能读得清
Deepseek - OCR模型发布,通过光学压缩技术解决长文本处理的计算效率问题,能控制大模型token消耗成本。介绍了其架构设计、数据引擎及训练流程,还展示其用较少token超越现有模型的能力。
开源版MetaQuery来了!OpenUni用1.1B参数媲美BLIP3-o-8B,数据代码完全开源
南洋理工大学 S-Lab 和商汤科技团队推出开源版 MetaQuery——OpenUni,仅 1.1B 参数达 8B 模型性能,代码、权重、数据全开源。它架构极简、参数高效,还继承了多模态理解能力。
AI 增强截图项目,爽歪歪~
日常截图后手动处理文字、公式、表格耗时又易出错。开源项目`Snippai`将截图与智能分析融合,是跨平台智能截图工具,能自动识别内容类型并处理,有多种功能,安装使用简单。
AI生的图能分图层,Agent控制能力进入下半场
Lovart上线Layered Image Editing功能,可自动识别图片里的文字、主体、背景并拆成独立图层,每个图层能单独编辑。其还有快速模式,模型库更新快,能降低AI生图门槛。
NVIDIA重磅开源!OmniVinci 仅 9B 模型就拿下多模态冠军!
英伟达推出全模态大语言模型 OmniVinci,架构有三大创新。OmniVinci - 9B 模型表现亮眼,多测试中大幅超 Qwen2.5 - Omni,且训练量仅为其六分之一。其架构经多阶段流程实现全模态理解,还支持多种功能。
开源屏幕感知AI助手,快捷键即调,随时看懂屏幕上的一切!
日常Windows桌面工作调用AI助手常打断专注流。GitHub新开源工具Everywhere,能自动感知屏幕内容,快捷键即调,支持多模型,有网络搜索和Markdown渲染功能,多种场景适用。
腾讯开源框架 Kuikly 再升级!率先适配 “液态玻璃”,原生体验更极致
腾讯开源框架Kuikly再升级,在苹果发布iOS 26系统背景下,新增“液态玻璃”适配。文章分析了“液态玻璃”给跨端框架带来的挑战,对比不同架构路线适配情况,还介绍了Kuikly的适配经验。