「手写文本识别」共找到 727 篇相关文章
重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!
传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B多模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于多场景。
IEEE TPAMI 2025 | 北京大学提出LSTKC++,长短期知识解耦与巩固驱动的终身行人重识别
北京大学周嘉欢团队在IEEE TPAMI发布LSTKC++研究成果。该框架引入长短期知识解耦等机制,保障模型学习新知识和记忆历史知识。代码已开源,研究在性能和效率上优势明显,有广泛应用价值和拓展空间。
超过GPT-image-1!大黑马Black Forest刚开源新模型,只用文本实现一键PS
今日凌晨,Black Forest开源文生图模型FLUX.1-Kontext开发者版本,功能类似PS,用自然语言就能一键P图。测试显示它超GPT-image-1,成最强开源文生图模型之一,还在架构、训练、工程层面做了优化。
故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究
OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。
让大模型基于「图像事实」说话:用事实文本+自适应编辑,让语言偏见无处遁形丨ICLR'26
多模态大模型看图常“脑补”,存在对象幻觉问题。北航团队提出AFTER框架,含FAS和QAO模块,能在主流LVLM和基准上显著降低幻觉,且推理开销低,为多模态助手落地提供实用路径。
大模型开发实战从入门到入坑:动手写一个MCP Server去理解MCP背后的技术原理
文章聚焦MCP协议,介绍其是规范应用向大模型提供上下文的开放协议,能让模型调用接口更简单、实现开发解耦。还深度解析技术原理,手把手教从0到1实现MCP Server,助读者理解背后技术。
刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%
月之暗面推出全新注意力架构Kimi Linear,有望成下一代Agent LLM基石技术。它解决了LLMs处理长序列任务的瓶颈,性能超传统机制,还开源了核心代码。Kimi Linear的KDA模块提升了表达和硬件效率,实验表现佳。
【GitHub 10.9k star】DeepCode:把论文和需求文档“一键变代码”的多智能体开发神器,真能干掉手写样板?
DeepCode 是香港大学开源的多智能体开发平台,支持将论文、需求文档等转化为生产级代码。它能解决论文复现、原型开发等痛点,有多项特色功能,在性能对比中领先,适用于多类场景。
0.5B以小搏大拿下端侧模型新SOTA:4090可跑,长文本处理5倍常规加速丨清华&面壁开源
清华大学和面壁智能团队开源MiniCPM 4,有8B、0.5B两种参数规模,以22%训练开销达同级别最优。它在架构、推理、数据、训练多方面创新,性能领先,适用于综述生成、工具调用等场景。
Google 开源 InkSight,把手写笔记直接变成可编辑数字笔记!
Google 开源 InkSight,能将手写照片转为数字墨迹,与传统 OCR 不同,它可「还原书写方式」。具备离线转在线、多语言支持等功能,核心是「阅读 + 书写」双重训练,有两种使用模式。