生物医学基准测试」共找到 2059 篇相关文章

产品应用7

太牛了~~复杂表格Cell合并、跨页拼接,中文领域96%,甩MonkeyOCR 20%

在PDF文档解析领域,复杂表格解析是难题。今天分享的OCRFlux是基于qwen2.5vl - 3B模型微调的解决方案,有单页解析和跨页段落/表格合并等创新点,测试得分超96%,远超MonkeyOCR等。

PaperAgent
产品应用7

华为昇腾推理对决:开源vLLM vs 官方MindIE,数据说话「Qwen与DeepSeek推理实测」

文章围绕华为昇腾推理,对比开源vLLM与官方MindIE。借助GPUStack平台测试Qwen与DeepSeek模型,分析不同场景性能。指出vLLM和MindIE各有优势,还强调构建国产AI推理生态需多要素,鼓励开源协作。

AI寒武纪
开源动态8

具身智能的Skill时刻!英伟达开源机器人技能库,Jim Fan:范式变了

英伟达开源能让机器人持续成长的技能库ASPIRE,类似机器人版Coding Agent,会沉淀机器人操作经验。英伟达机器人主管Jim Fan称其代表全新持续学习范式,论文实验验证其效果好于此前方法。

量子位
算法论文8

CVPR 2026 | 1000万段驾驶视频,教会模型如何估计相机位姿

Wayve的LA - Pose研究,不依赖百万级3D标注,从约1000万段未标注驾驶视频自监督学习‘潜在动作’,再用少量3D标注微调,转化为相机位姿估计能力,在多基准上提升精度且泛化能力强。

机器之心
算法论文8

一句话生成无限逼真3D场景!匹兹堡大学新作直击VLM空间推理软肋丨CVPR'26

VLM在3D空间推理上表现不佳,且缺乏合适测试基准。匹兹堡大学团队提出InfiniBench框架,用LLM Agent迭代优化和聚类策略,可按需生成3D场景,还能精准定位大模型空间推理缺陷。

量子位
算法论文8

像开发软件一样造世界,Agent2World来了,把世界模型做成可运行的符号环境

为让模型真正“能行动”,需可执行、可验证的符号世界模型,但现有自动生成路线有困局。研究团队提出 Agent2World,经实验验证有显著效果,能稳定产出高质量符号世界模型,开辟 AI 理解现实环境新可能。

机器之心
算法论文8

6款小游戏难倒所有顶级VLM!愤怒的小鸟让它们全军覆没,性能不如随机猜测

淘天集团未来生活实验室提出首个系统性评估多模态大模型(VLM)交互式物理推理能力的综合基准DeepPHY。它集成六个物理环境,对17个主流VLM测试,揭示其在物理交互等方面短板。

量子位
开源动态8

NeurIPS 2025 | 中科大、港中深、通义千问联合发布CoRT:仅30个样本教会大模型高效推理,token消耗降低50%

大型推理模型在精确数学计算上存在问题,如认知冲突、行为低效、数据稀缺。中科大、港中深、通义千问联合推出CoRT框架,用创新数据合成与多阶段训练,提升模型推理能力和效率,成果已开源。

机器之心
开源动态8

Kimi开源新线性注意力架构,首次超越全注意力模型,推理速度暴涨6倍

月之暗面发布开源Kimi Linear架构,用新注意力机制首次超越全注意力模型。长上下文任务中,它减少75%的KV缓存需求,推理加速达6倍。核心创新Kimi Delta Attention有细粒度遗忘门控等特点。

量子位
算法论文7

震撼实锤!清华姚班校友揭「1.4×加速」陷阱:AI优化器为何名不符实?

为降低大模型预训练成本,近年新优化器频出,宣称加速1.4×到2×却难落地。斯坦福研究指出方法学缺陷,对比不同缩放范式加速差异,给出优化器设计见解,证实严格基准评测必要。

新智元