「评估框架」共找到 2216 篇相关文章
Groupe SNCF 使用 Talos OS 和 Kubernetes 实现基础设施的现代化
法国国家铁路集团(Groupe SNCF)从传统 VM 的 Kubernetes 部署迁移到基于 Talos OS 和 OpenStack 的云原生平台,解决运维挑战。虽面临组织和技术难题,但紧密合作加强了平台,未来将扩展平台、迁移关键应用。
打造图像编辑领域的ImageNet?苹果用Nano Banana开源了一个超大数据集
苹果研究团队提出Pico - Banana - 400K数据集,基于Nano - Banana在OpenImages实拍照片生成编辑对。其系统化设计保证质量与多样性,还构建自我编辑评估流程,为图像编辑模型训练评测奠定基础。
大语言模型的解耦:人工智能基础设施的下一轮进化
人工智能模型发展快,但基础设施滞后,传统单体式服务器架构成瓶颈。文章介绍大语言模型推理的预填充与解码阶段差异,指出解耦架构可突破困境,还阐述其经济影响、实施策略、应用案例及未来展望。
狂涨20.8K star!GitHub 官方出品,强烈推荐!
介绍开源项目 `GitHub Desktop`,它基于Electron开发,用TypeScript编写并使用React框架,支持Windows和Mac,集成常用Git操作,有直观图形界面等特色,助开发者轻松使用Git,目前获20.8K star。
百度Qianfan-VL,发票/图表/合同等PDF识别94.75%刷新纪录!
当前主流视觉 - 语言模型在企业级应用有难点,百度千帆团队提出Qianfan - VL系列多模态大模型,在通用和企业级任务表现出色,基于自研芯片训练,还提供框架与管线降低成本。
YC 编写的 《Vibe Coding 指南》
本文是 YC 编写的《Vibe Coding 指南》,采访多位创始人总结出 AI 协作编程指南,涵盖规划流程、版本控制、测试框架等多方面,还提及 AI 在编码外的应用及持续改进方法。
蚂蚁集团发布KAG-Thinker,多跳问答慢思考,医疗领域拿下87分
在LLM问答领域,多跳问题存在局限性,现有方法缺乏严谨性等。KAG - Thinker是基于KAG框架的模型,将复杂问题分解,通过多模块优化知识获取,在医疗领域实用,稳定性也出色。
斯坦福:优化器「诸神之战」?AdamW 凭「稳定」胜出
斯坦福大学 Percy Liang 团队研究指出,虽有不少声称能显著加速的优化器替代方案,AdamW 仍为预训练稳健首选,但矩阵型方法在特定数据–模型比例下优势明显。研究还揭示了现有研究的方法论缺陷。
「一只手有几根手指」,你的GPT-5答对了吗?
CMU博士生Tairan He测试发现GPT - 5答错‘一只手有几根手指’问题,指出语言难满足视觉与机器人领域需求,需VLM和VLA模型。编辑部测试发现顶尖大模型面对常识问题也会‘翻车’,还探讨了应对方法。
EvaLearn:AI下半场的全新评测范式!
OpenAI研究员指出传统基准测试难衡量AI实际效用。复旦大学与字节跳动等团队提出全新评测范式EvaLearn,以连续问题求解为核心,构建问题并设评分标准,对九个前沿大模型研究有诸多发现。