「多语言推理」共找到 6124 篇相关文章
我去,还能这么玩?AI新宠DocExt:纯本地文档抽取,开源免费还无依赖!你还在为OCR头疼吗?
DocExt 是 Nanonets 开源项目,为全流程无 OCR、零云依赖的本地文档结构化提取工具,适用于多种文档类型,支持字段与表格识别。它零 OCR 误差小、可本地部署,还能灵活接入模型。
可从表复杂文档中提取结构化数据的Python库agentic-doc,支持100+页PDF长文档
LandingAI的Agentic文档提取API可从复杂文档提取结构化数据,Python库agentic-doc封装该API,支持100+页PDF长文档,有自动重试、并行处理等功能,还能可视化调试。
华为海思老兵上海创业,拿到亿元投资!
过去两年汽车行业竞争激烈,智能驾驶芯片成关键领域。近日,上海为旌科技完成A2轮融资首次交割,获君信资本1亿元。其创始人郑军是海思老兵,带领公司研发多款芯片,还提出诸多行业见解。
AI 编程越来越厉害了,我要怎么提升自己的系统架构能力?
文章指出 AI 写代码能力提升,对程序员系统架构能力要求更高且难被替代。介绍系统设计概念,分析做系统设计的难点,给出新人提升系统设计能力的方法,还说明 AI 可辅助提升该能力。
全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%
MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。
SearchAgent-X: 打破效率桎梏,释放下一代「AI搜索智能体」的真正潜能
论文提出SearchAgent-X框架解决AI搜索智能体效率难题。研究剖析效率瓶颈,发现精度和延迟问题,提出优先级感知调度与无停顿检索技术,经评估大幅提升性能且不牺牲答案质量。
Linear-MoE:线性注意力遇上混合专家的开源实践
近年来,线性序列建模和混合专家(MoE)研究进步大,但两者结合研究少,相关开源实现缺失。上海人工智能实验室团队的 Linear - MoE 首次实现两者高效结合并开源技术框架,实验验证其有诸多优势。
21 页 PDF 实锤 Grok 3“套壳”Claude?Grok 3 玩自曝,xAI工程师被喷无能!
网友 GpsTracker 爆料,xAI 公司的 Grok 3 在“思考模式”下自称是 Anthropic 公司的 Claude 3.5。多种模式测试显示异常回应仅在“思考模式”触发,21 页 PDF 记录也证实其“自曝”。此事引发热议,有人吐槽预训练团队水平差。
最新!OpenAI:GPT-5将实现大统一,Codex最佳实践是这样的
OpenAI Codex在Reddit AMA活动中,核心负责人围绕先推云端代理、GPT - 5与Operator整合等问题给出路线图。如Codex - 1预览情况、CLI设计、使用场景、安全模型、接入计费及API生态等方面都有说明。
OpenAI官方发布【Codex 上手指南】
OpenAI 昨晚推出 Codex 研究预览版,这是强大的远程编码智能体,能导航代码库、解答疑问等。官方还发布使用指南视频,介绍了快速上手步骤、工作方式,以及提升效能的方法。