统一建模框架」共找到 2147 篇相关文章

产品应用8

金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%

2025年6月以来多模态文档解析成前沿课题。MonkeyOCR v1.5是全新框架,在OmniDocBench v1.5等基准上全面突破,复杂表格等场景提升9.7%,采用两阶段解析管道和复杂表格处理方案。

量子位
开源动态8

一个模型读懂所有医学数据,Hulu-Med探索医学大模型开源新范式 | 浙大x上交xUIUC

Hulu - Med是浙大、上交、UIUC等联合提出的通用医学视觉语言大模型,首次在单一模型统一理解医学多类数据。它开源透明,训练成本低,性能媲美GPT - 4.1,为医学AI带来新范式。

量子位
推荐文章8

李飞飞万字长文爆了!定义AI下一个十年

李飞飞新文指出AI下一个前沿是「空间智能」,揭秘其「世界模型」核心框架和三大核心支柱。构建具备空间智能的AI需世界模型,其应用涵盖创意、机器人、科学医疗等领域,有望提升人类生活。

力学与人工智能
产品应用8

nndeploy:一款基于可视化工作流的AI部署工具

nndeploy是简单易用且高性能的AI部署框架,可将推理优化转化为可视化工作流,无需前端技术栈。它还提供端侧完整AI部署方案,有多端推理等功能,介绍了使用方法与技术原理。

GiantPandaLLM
产品应用8

全球首个「导航大脑」上线!一句话让机器人自己找路回家

银河通用联合多所大学发布全球首个跨本体全域环视导航基座大模型NavFoM,让机器人能自主导航。它全场景、多任务、跨本体,重新定义导航逻辑,有技术创新和庞大训练数据,还衍生应用模型推动具身智能商业落地。

新智元
算法论文8

RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑

北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。

机器之心
推荐文章7

让Agent系统更聪明之前,先让它能被信任

本文从系统工程视角剖析 Agent 系统问题与复杂度,指出开发中‘简单’是假象,复杂性只是被转移。介绍了 Agent 开发各阶段难点,通过案例说明其落地困境,提出将其视为系统组件,先求稳定可靠,还提及开发思路、模式及最新进展。

阿里云开发者
开源动态8

开源对机器人的价值,远超大模型时代的想象丨唐文斌深度对谈抱抱脸创始人

Dexmal联合创始人唐文斌与Hugging Face联合创始人Thomas Wolf指出当前机器人研究痛点,联合推出开放、统一、可复现的真实世界机器人评测平台RoboChallenge.ai,探讨开源对机器人的价值、评测平台搭建等问题。

量子位
算法论文8

清华大学x生数科技:从波形到隐空间,AudioLBM引领音频超分新范式

音频超分辨率是提升音频体验的关键技术,但高频细节损失是挑战。OpenAI的Sora 2树立高保真音频生成标杆,现有学术模型有局限。清华与生数科技团队发表两项成果,AudioLBM展现通用高分辨率音频生成潜力。

量子位
算法论文8

刚刚,Meta风雨飘摇中发了篇重量级论文,作者几乎全是华人

风雨飘摇的Meta发布重量级论文《Agent Learning via Early Experience》,提出「早期经验」新范式,让AI智能体「无师自通」,为突破强化学习瓶颈提供新思路。该范式结合两种策略,实验效果显著,还指出了局限与未来方向。

新智元