「文档图像解析」共找到 944 篇相关文章
Harness Engineering实践,做了一个平台让AI一晚上自动评测和优化你的系统
作者分享搭建小平台实现全自动化评测与系统优化的实践,包括创建评测任务、集、报告等,通过钉钉文档、绘报等案例展示操作,还能自动优化系统,不过需系统UI规范、AI Coding含量高。
开源仅一周,鹅厂文生图大模型强势登顶,击败谷歌Nano-Banana
腾讯混元团队开源的原生多模态生图模型混元图像 3.0,开源仅一周就在国际权威评测榜单 LMArena 上超越谷歌 Nano - Banana 等,位列文生图综合和开源榜单第一。实测表现出色,技术上也有诸多创新。
评论送书 | Code Agent实战案例——用Pywen Agent、Claude Agent和Codex Agent从零开始构建一款网页游戏
本文展示用三大Code Agent依斯特鲁普效应构建网页游戏,对比其表现,还介绍让AI做测试方案、写文档,体现Code Agent在快速原型开发全生命周期的应用,还推荐相关书籍解答不同人群疑问。
我玩过的所有龙虾里,和飞书结合最好的就是它了,没有之一
作者分享ArkClaw使用体验,它与飞书结合佳,配置快。能读飞书文档、查日程,联网搜索用字节搜索引擎,还可装Skill生成报告等。虽有不足,但对中文用户实用,Coding Plan用户可免费体验。
GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!
第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。
社区供稿 | 全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型 Intern-S1 | WAIC 2025
7月26日,上海AI实验室在WAIC 2025上发布并开源科学多模态大模型Intern-S1。它融合书生家族优势,首创跨模态科学解析引擎,在多学科任务上超越顶尖闭源模型,技术创新显著,未来将持续开源。
跑分第一,实战拉胯!GPT Image 1.5被骂惨,奥特曼这波悬了
OpenAI推出新一代旗舰图像模型GPT Image 1.5,生图能力强,免费用户可上手,开发者能调用API。它在跑分榜单成绩优异,但网友实测发现是‘高分低能’,引发吐槽。此外,其API价格降20%,此次更新是回击谷歌。
理解帮助生成?RecA自监督训练让统一多模态模型直升SOTA
统一多模态模型在视觉理解和生成能力上不平衡,常理解强但生成弱。本文提出重建对齐(RecA)自监督后训练方法,不改动架构,用未标注图像训练,在多模型实验中提升性能,部分达SOTA。
钉钉为 AI 找了个绝佳工位
随着AI浪潮袭来,企业让AI Agent落地提效遇难题。钉钉以数据表格为架构实现AI应用化,将单元格变为AI“工位”,汇集AI工具、沉淀业务系统,还融合表格与文档、支持提醒功能,解决企业痛点。
昆仑万维多模态视频生成开源,影音图文全统一
昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。