「FutureX 动态评测基准」共找到 975 篇相关文章
多模态大模型持续学习系列研究,综述+Benchmark+方法+Codebase一网打尽!
近年来,生成式AI和多模态大模型进展显著,但在动态环境下实现持续学习是挑战。中科院自动化所联合香港院AI中心系统性研究,提出综述、方法、Benchmark和Codebase,为相关人员提供全面支持。
Kimi 大模型训推混部的稳定性与资源优化实战
月之暗面系统工程师黄维啸在 QCon 大会分享 Kimi 大模型训推混部实践。介绍了训推集群挑战,如故障多、资源利用低等,还阐述了全链路稳定性提升、资源高效利用及强化学习混合部署等方案。
金融智能体真的是大模型落地“最后一公里”?
InfoQ《极客有约》X AICon 直播栏目邀请业内人士探讨金融 AI 大模型实践现状。指出大小模型融合是主要方案,智能体有应用但也有问题。还分享了评估 AI 项目的要点、智能体应用案例及未来布局方向。
3D-R1:让AI理解3D世界的下一步
文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。
模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作
北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。
Jina Embeddings v4 的量化感知训练
文章聚焦Jina Embeddings v4的量化感知训练。介绍量化技术可压缩向量体积、提升检索效率,对比四种主流量化方法,重点实验PTQ和Output QAT,还测试非对称量化,给出实验结果与结论。
RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈
大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。
北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师
北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型在动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。
60%情况下,主流大模型没理解风险只是装懂!别被模型的“安全答案”骗了
研究发现超60%案例中主流推理模型生成合规答案却未真正理解风险,存在系统性漏洞。淘天集团团队引入“表面安全对齐”术语,推出Benchmark研究该现象,还介绍了数据集生成流程及评测指标。
一文讲透程序编排的核心方式:从表达式语言到并行化实践
文章围绕程序编排展开,介绍单语句编排、类编排、流程编排、并行化编排等核心方式,分析多种编排框架特点及适用场景,还提及Lindorm泛时序数据解决方案,为开发者提供编排参考。