「测试任务」共找到 3332 篇相关文章
太牛了~~复杂表格Cell合并、跨页拼接,中文领域96%,甩MonkeyOCR 20%
在PDF文档解析领域,复杂表格解析是难题。今天分享的OCRFlux是基于qwen2.5vl - 3B模型微调的解决方案,有单页解析和跨页段落/表格合并等创新点,测试得分超96%,远超MonkeyOCR等。
华为昇腾推理对决:开源vLLM vs 官方MindIE,数据说话「Qwen与DeepSeek推理实测」
文章围绕华为昇腾推理,对比开源vLLM与官方MindIE。借助GPUStack平台测试Qwen与DeepSeek模型,分析不同场景性能。指出vLLM和MindIE各有优势,还强调构建国产AI推理生态需多要素,鼓励开源协作。
具身智能的Skill时刻!英伟达开源机器人技能库,Jim Fan:范式变了
英伟达开源能让机器人持续成长的技能库ASPIRE,类似机器人版Coding Agent,会沉淀机器人操作经验。英伟达机器人主管Jim Fan称其代表全新持续学习范式,论文实验验证其效果好于此前方法。
LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制
中国科学院自动化研究所与腾讯AI Lab团队从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上性能显著优于传统算法。
Anthropic 发布 AI Agent 上下文工程指南
今年6月Andrej Karpathy提出用「上下文工程」取代「提示词工程」。Anthropic发布工程博客呼应此观点,指出构建AI应用重心转向策划上下文。文章详述上下文工程重要性、有效上下文剖析、检索及长时任务应对技术等。
模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作
北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。
华为多路径推理破解大模型数学瓶颈,准确率超97%|ICML 2025
大模型处理复杂问题常“翻车”,华为诺亚方舟实验室提出思维森林(FoT)框架,借鉴人类认知方式,打破线性推理范式。FoT在多个数学推理任务表现出色,准确率超先进模型,将在ICML 2025开源。
Transformer八子初创:AI横扫NP难题竞赛,Top 2%选手竟是智能体!
Transformer作者Llion Jones初创公司测试AI智能体,其在NP难题竞赛中排第21。Sakana AI与AtCoder合作构建ALE - Bench,设计ALE - Agent参赛成绩优异,不过它也有调试难等局限,未来待改进。
刚刚,DeepSeek多模态技术范式公布,以视觉原语思考
DeepSeek发布多模态模型并公布技术报告,提出‘以视觉原语思考’。该模型解决多模态大模型‘指代鸿沟’问题,有把坐标变思维单元、7056倍视觉压缩、精心设计冷启动数据等创新,实验在多任务上超主流模型。
马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1
谷歌Gemini 3将上线消息正热时,马斯克旗下xAI的Grok 4.1凌晨上线。它有两个“形态”,免费开放且有APP版。在LMArena测试中表现优异,事实稳定性、情商、创意写作等能力提升,实测也有不错表现。