「图文混排文档」共找到 484 篇相关文章
RAG效果不佳?先别急着微调模型,这几个关键节点才是优化重点
文章深入探讨RAG技术实现与优化,指出其在AI应用开发中常被当黑盒,从文档分块、索引增强、编码、混合检索到重排序等关键环节解析,强调结合场景调优以提升召回与精确率。
原生理解生成统一:商汤开源SenseNova U1,用统一架构终结「缝合怪」多模态
商汤开源日日新 SenseNova U1 系列原生理解生成统一模型,采用 NEO-unify 架构,只需 8B 小参数就能实现很多商业闭源模型效果。在多测评维度性能领先,还能实现连续性图文创作输出,解决理解与生成断层问题。
不吹不黑,在Agent任务上,kimi 2.6确实让我忘了Claude。
Kimi K2.6发布并开源,代码和Agent能力提升。作者测试发现,它在部署Claude Code源码、网站生成、多智能体任务等方面表现出色,审美提升,思维活跃,还能复刻文档风格,开源释放了前沿编程能力。
SVG性能比肩GPT/Claude,腾讯开源3B模型HiVG,让Token「懂几何」
腾讯混元团队开源仅3B参数的HiVG,它是面向SVG生成的层次化分词框架,减少63.8% token数量,多项指标超越GPT-5.2等闭源模型及8B级开源模型,还在人类评测中表现出色。
GLM-5正式发布,744B参数,对标Claude
GLM-5正式发布,对标Claude,参数从355B扩至744B,预训练数据增加。采用GlmMoeDsa架构,部署成本降低。数据表现佳,在多测试中成绩亮眼,还能直输Office文档,部署支持多框架和国产芯片,早期反馈积极。
1000+页PDF解析速度暴涨3倍,MinerU模式不香了
百度PaddleOCR推出HPD - Parsing小模型,文档解析速度大幅提升,是上一代最快模型的1.62倍、自身原解码方式的3.06倍。它采用层级并行解码架构,有两层并行设计,效果出色且兼容性好,还分享了优质训练方法和优化思路。
大模型虽好,但恕我直言:在OCR面前,开源小模型更香
作者所在公司项目需处理大量纸质文档,起初考虑云端大模型API调用和开源大模型本地化部署,却因成本高、硬件要求高受阻。后经推荐调研PaddleOCR,其功能全、成本低、易用性强,最终被选为项目核心方案。
Harness Engineering实践,做了一个平台让AI一晚上自动评测和优化你的系统
作者分享搭建小平台实现全自动化评测与系统优化的实践,包括创建评测任务、集、报告等,通过钉钉文档、绘报等案例展示操作,还能自动优化系统,不过需系统UI规范、AI Coding含量高。
腾讯开源最强3D生成模型,消费级显卡就能跑 | CVPR
在CVPR上,腾讯混元3D 2.1模型宣布开源。相比前一代,它实现几何与纹理双重优化,纹理贴面提升大,达当前开源3D模型SOTA水平。全链路开源,适配消费级显卡,Hugging Face下载量超180万。
评论送书 | Code Agent实战案例——用Pywen Agent、Claude Agent和Codex Agent从零开始构建一款网页游戏
本文展示用三大Code Agent依斯特鲁普效应构建网页游戏,对比其表现,还介绍让AI做测试方案、写文档,体现Code Agent在快速原型开发全生命周期的应用,还推荐相关书籍解答不同人群疑问。