「可灵3.0」共找到 6015 篇相关文章
小模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源
微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖大模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。
最强开源0.9B级OCR模型!本地Agent、知识库都有救了!
百度飞桨PaddleOCR团队开源多模态文档解析模型PaddleOCR-VL,参数量仅0.9B,对算力要求低。它在OmniDocBench V1.5榜单屠榜,经测试,能精准识别发票、图表等,适合本地环境与资源受限设备。
新手必备!Cursor 1.0 完全上手指南:从零开始用 AI 玩MCP
本文是Cursor 1.0的上手指南,涵盖下载安装、核心功能、中文环境设置、工作方式、MCP基础设置、AI使用方法及使用渠道等内容,助新手用AI玩MCP。
只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型。
近期OCR赛道火热,作者应读者要求解读PaddleOCR-VL。它是百度PaddleOCR系列新模型,仅0.9B参数,在OmniDocBench v1.5评测多项领先。其架构高效,实测处理各类文档能力强,已开源。
Mistral 发布 OCR 3,提升了手写及结构化文档识别的准确率
Mistral 发布 OCR 3,在多种文档类型上精度更高,超越前一代产品。能提取文本、识别图像并保留文档结构,输出 Markdown 格式。早期用户认可其性能和多语言支持,生产部署扩展快,价格有优势。
北大团队让AI学会考古!全球首个古希腊陶罐3D视觉问答数据集发布,还配了专用模型
北大团队推出全球首个面向古希腊陶罐的3D视觉问答数据集VaseVQA - 3D,配套专用视觉语言模型VaseVLM。传统模型面对文化遗产复杂对象有不足,新数据集和模型让AI迈向‘文化考古Agent’,未来将拓展到更多领域。
文档OCR新范式0.84 页/秒,吊打MinerU Qwen2.5VL
MonkeyOCR采用SRR三元组范式,简化多工具管道,避免整页文档处理低效率。与MinerU、Gemini 2.5 Pro等对比,性能表现优,处理速度达0.84页/秒,但对扫描件效果欠佳,架构含多模型,可通过特定地址测试。
AI无师自通,搞定所有家务!π0.5突破泛化极限,UC伯克利系出品
具身智能最大挑战是泛化能力,美国具身智能公司Physical Intelligence推出π0.5 VLA模型,通过异构任务协同训练实现泛化,可在全新家中执行各种家务,虽有不足但向广泛泛化物理智能迈进。
吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板
Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用自监督学习,无需人工标注,可生成强大图像特征,在多任务超专用方案,NASA已用其探索火星,还能推动多行业进步。
新一代AI教师是什么样?学而思让它从L2「助手」跃迁至L3「老师」
在AI应用落地成关键的当下,教育成AI融合创新前沿。好未来CTO田密提出「AI教师L1 - L5分级」理论,指出当前AI老师达L2水平,L3正演进。学而思学习机的「小思AI一对一」迈向L3,依托硬件和自研大模型,结合优质内容,从可用走向可信。