MonkeyOCR v1.5」共找到 3504 篇相关文章

算法论文8

“交互式Scaling”:增加Agent与环境交互的深度和频率来提升性能

在AI发展中,商业研究Agent是“黑箱”,开源研究Agent性能有差距。MiroMind团队推出MiroThinker v1.0,提出“交互扩展”提升性能,在多基准测试表现出色,也指出了当前版本的局限。

深度学习自然语言处理
新闻资讯8

硅谷热议:最快语音转文字模型

AI语音独角兽ElevenLabs发布Scribe v2 Realtime实时语音转文本模型,实现150毫秒超低延迟、93.5%高准确率,覆盖90多种语言,打破速度与精度不可兼得困境,此前该领域痛点多。

量子位
开源动态7

DeepSeek最新模型意外泄露~

DeepSeek最新模型DeepSeek-V3-0526疑似泄露,消息源于https://docs.unsloth.ai/basics/deepseek-v3-0526-how-to-run-locally ,其性能媲美GPT - 4.5 / Claude Opus,或成最强开源模型,信息若属实将很快发布。

PaperAgent
开源动态8

一个超级搜索Agent开源,超低成本拉满搜索推理能力!小参数、慢思考。

MiroThinker 1.5发布,打响2026年AI模型进步第一枪。它以小参数实现高性能,解决信息雾霾、AI幻觉、决策无力等问题,通过交互式扩展和时序敏感训练沙盒技术,展现强大搜索推理能力。

开源AI项目落地
新闻资讯7

现在,最会赚钱的AI是Qwen3!全球六大模型厮杀,Top 2来自中国

大模型「炒股」大赛中,阿里Qwen3 Max逆袭DeepSeek夺冠,成「最会赚钱」模型,GPT - 5成「最会赔钱」AI。比赛由Nof1实验室打造,Qwen3 Max成绩体现国产大模型实力。

新智元
新闻资讯7

OpenAI研究大模型对GDP贡献,三大行业已能代替人类,并自曝不敌Claude

OpenAI推出新评估方法GDPval,跟踪模型在现实任务表现。评估显示前沿模型接近专家水平,Claude Opus 4.1表现最佳,GPT - 5准确性出色。还发布黄金子集和评分服务,其处于起步阶段将持续扩展。

机器之心
推荐文章7

我写 nano banana pro 提示词时的原则和策略

作者分享写 nano banana pro 提示词的原则与策略,原则是做成模板、结合模型能力;策略是先跑通原型再抽象成模板;不过度精简提示词,还介绍用 GPT-5.1 等工具辅助。

宝玉AI
开源动态7

The Batch:829 | DeepSeek 是怎么做到的

DeepSeek 去年末以低成本训练出先进开源大模型引关注,近日团队披露构建 DeepSeek - R1 和 DeepSeek - V3 的软硬件方案,降低内存和计算需求,其细节公布让更多团队有机会参与前沿研发。

DeeplearningAI
开源动态8

真可用!美团数字人模型开源,MV、电商等统统拿下

美团开源数字人视频生成框架 LongCat - Video - Avatar 1.5 版本,换音频编码器、加速推理,支持多任务与多场景。经770人评测,它在多维度领先对手,各方面表现均衡,效率与质量兼得。

AIGC开放社区
新闻资讯7

DeepSeek“极你太美”bug,官方回应了

DeepSeek V3.1调用API开发时输出常现“极”字,在火山引擎、腾讯CodeBuddy等多平台出现,影响代码编译。官方称将在近版本修复,网友猜测或因数据清洗不彻底。

量子位