「统一OCR范式」共找到 1475 篇相关文章
定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生多模态嵌入模型,延迟骤降70%
谷歌昨夜推出首个基于 Gemini 架构的原生多模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将多类型数据映射到统一嵌入空间,多项基测排名第一,还获早期合作伙伴高度评价。
AI问答,直接「拍」给你看!来自快手可灵&香港城市大学
来自快手可灵团队和香港城市大学的研究者提出「视频作为答案」任务范式,发布VANS模型。它由视觉语言和视频扩散模型构成,通过联合分组相对策略优化算法协同优化,在教学和预测应用上效果超现有模型。
让 AI 自己打怪升级,Meta用Self-play RL把Coding推向超级智能
Meta FAIR、Meta TBD Lab等朝着“超级智能软件工程Agent”迈出第一步。SSR让大模型零人类标注,靠自生成Bug和自修复稳定碾压人类数据基线,新旧范式对比优势明显,还介绍方法、实验结果与理论洞察。
阿里安全AGI一次发布3款LLM,8B多维度领先GPT-5.4
近期,阿里安全AGI实验室发布3款Yuvion LLM,在AI安全与内容安全领域多维度领先。它以‘对抗即智能’为原则,构建五类数据体系,采用三阶段训练范式,通过YLRE四级评测体系验证能力。
用2D先验自动生成3D标注,自动驾驶、具身智能有福了丨IDEA团队开源
IDEA团队张磊团队提出OVSeg3R开集3D实例分割学习新范式。它无需人工后处理和3D掩码标注,降低训练成本,有望让3D实例分割商业落地,可用于自动驾驶、智能家居等领域。
上海AI Lab发布混合扩散语言模型SDAR:首个突破6600 tgs的开源扩散语言模型
上海人工智能实验室提出全新范式SDAR,通过‘训练 - 推理解耦’融合AR模型高性能与扩散模型并行推理优势。实验证明,SDAR性能与原版AR模型持平或超越,还能加速推理,且已全面开源全系列模型。
一盘大棋!OpenAI「截胡」IMO金牌,奥特曼为GPT-5献上「核弹级」预热
OpenAI用全新通用推理模型拿下IMO金牌,抢了谷歌DeepMind的风头。此模型是融合新通用技术的推理LLM,在推理时间跨度和效率上有进步。奥特曼借此为GPT - 5预热,陶哲轩指出缺乏统一标准时对比AI表现无意义。
振臂一挥,大半个具身机器人圈都来了!智源研究院:别藏了,谁贡献数据多,谁的大脑就更好用
2025智源具身智能Open Day上,智源研究院院长邀厂商共享数据,称谁家贡献多,具身大脑在其机器人上更好用。智源无商业包袱,开源数据、统一评测,布局具身大小脑体系,欲做具身智能“安卓”。
视频进入可编辑时代:藏师傅教你视频版 Banana 可灵 O1
可灵发布大一统视频、图像生成和编辑工具 O1,支持在一个界面完成视频图片编辑生成。此次更新统一多模态视频大模型,支持多模态输入,有诸多新特性,还支持自由选择视频生成时长和风格转换等。
Vidu Q2的参考生视频,是AI视频多参党的胜利。
作者分享使用Vidu Q2多图参考生视频的体验,认为它是AI视频多参党的胜利,是新工作流范式。Q2在一致性、表演能力和多风格表现力上大幅进化,价格实惠,还推出APP,多图参考生视频未来可期。